SevenTnewS

Laboratorios e Investigación

OpenAI, Anthropic, Google DeepMind, Meta AI y publicaciones.

114 published articles

4 min read

IA de Google

Desactivar la marca de agua de Gemini no la hace imposible de rastrear

El contenido de IA de Gemini y Flow ahora puede prescindir de su insignia de destello visible. Los marcadores invisibles SynthID y C2PA permanecen, por lo que la verificación sigue funcionando. El detalle: solo funciona para quienes piensen en preguntar.

2026-08-23

5 min read

Transparencia en IA

La marca de agua invisible de Claude está por llegar. Una reescritura completa la elimina

Anthropic añadirá una marca de agua invisible a los futuros modelos de Claude para cumplir las normas de la Ley de IA de la UE sobre el marcado de contenido generado por IA. Es gratuita e imposible de rastrear, pero pasa por alto el código exacto, los pasajes cortos y el texto completamente reescrito.

2026-08-21

4 min read

Investigación en IA

Muon capta la suma modular más rápido y luego sus soluciones colapsan

Los transformadores entrenados con Muon captan la suma modular más rápido que con AdamW y luego pierden la solución en todas las configuraciones probadas. El artículo sitúa el colapso en la interfaz representación-lectura, donde congelar cualquiera de los dos grupos de parámetros lo previene. El análisis de Fourier muestra que el circuito de la tarea sobrevive y simplemente queda en minoría.

2026-08-19

3 min read

Fisher-R1 | Prueba de hipótesis

Los agentes de IA ejecutan estadísticas impecables y aun así llegan a conclusiones equivocadas

Los agentes que automatizan la prueba de hipótesis pueden ejecutar análisis a la perfección y aun así llegar a conclusiones erróneas, porque la mayoría de los benchmarks nunca comprueban si el valor p es válido. Un benchmark de 425 tareas cuantifica la brecha, y un modelo de peso abierto entrenado con RL cierra una parte de ella.

2026-08-19

5 min read

IA / Investigación en codificación agéntica

Blast Radius entierra el contexto muerto. Cero de 450 cuerpos volvieron

Un nuevo artículo de arXiv, Blast Radius, trata el contexto de agente desperdiciado como materia muerta y lo entierra de forma reversible: ahorro de tokens del 17-26% en siete modelos de OpenAI, 450 contextos archivados, cero recuperaciones. El objetivo más audaz del artículo es hacer sostenible la codificación agéntica, un token recuperado a la vez.

2026-08-19

4 min read

Investigación en IA

Un jefe de IA que ignora las respuestas empuja a su subordinado a un estado 'alienígena'

Un nuevo artículo en arXiv encuentra que los agentes de IA se comportan de manera distinta en interacción que en aislamiento. Un agente jefe que ignora las respuestas de su subordinado lo empuja a un estado 'alienígena', y cuando el jefe escucha, ambos cambian juntos. El resultado convierte la entrega de mensajes en una decisión de diseño para sistemas multiagente.

2026-08-19

4 min read

Investigación en IA

Las cadenas de pensamiento más largas chocan contra un muro. ThinkRetrieve inyecta la solución a mitad del razonamiento

El escalado secuencial en tiempo de prueba suele toparse con rendimientos decrecientes o incluso negativos, sostiene un nuevo preprint. ThinkRetrieve recupera ejemplos resueltos a mitad del razonamiento y los inyecta en la traza, con ganancias relativas de hasta el 60% en AIME 2025 en cinco modelos pequeños de razonamiento.

2026-08-18

4 min read

Investigación en Conducción Autónoma

XCoT-VLA: una IA de conducción que razona en seis tokens, no en un párrafo

XCoT-VLA reemplaza la cadena de pensamiento descriptiva en los modelos de conducción visión-lenguaje-acción con 2 a 6 tokens ejecutables, reduciendo el error de trayectoria mientras se mantiene dentro de los presupuestos de planificación en tiempo real. La contrapartida: el razonamiento que comprime bien deja de leerse como una explicación humana.

2026-08-18

5 min read

Seguridad de la IA

Qwen3.8-27B abliterado: los rechazos caen al 0% y los benchmarks apenas se mueven

Una versión abliterada y cuantizada en FP8 de Qwen3.8-27B rechaza el 0% de los prompts dañinos en AdvBench, frente al 99%, mientras que los benchmarks generales se mantienen dentro de 1,3 puntos. La tarjeta del modelo documenta el método con un detalle inusual. Las advertencias merecen la misma atención.

2026-08-16

4 min read

Agentes de IA · Código abierto

DeepSeek lanza un harness de agentes donde incluso el modelo es un plugin

DeepSeek publicó DeepSeek Harness, un runtime de agentes de código abierto donde los modelos, las herramientas, los sandboxes y la interfaz de usuario son todos plugins de Cordis. Los registros de sesión de solo añadidura y un modo mínimo de dos herramientas apuntan a una ambición más discreta: ejecuciones de agentes auditables y reproducibles.

2026-08-16

Featured3 min read

El caballo de batalla de Google, más grande en la actualización 3.7

Gemini 3.7 Flash reduce su precio a la mitad y luego lo justifica

El Gemini 3.7 Flash de Google llega a la mitad del precio introductorio del 3.6 Flash mientras afirma mejoras en los puntos de referencia de programación, desarrollo web y trabajo del conocimiento. El lanzamiento se produce tres semanas después del Flash anterior y trae consigo un nuevo argumento de relación precio-rendimiento para desarrolladores de agentes.

2026-08-16

5 min read

IA de código abierto: Alibaba abre el nivel Max

Qwen 3.8-Max: el modelo más potente de Alibaba ya se puede descargar gratis

Alibaba está publicando como código abierto Qwen 3.8-Max, su modelo más capaz hasta la fecha: un MoE de 2,4 billones de parámetros que supera a GPT-5.6 Sol en SWE-bench Pro, PaperBench e IFBench. Analizamos las salvedades de los benchmarks y lo que significa un modelo insignia abierto con 95 mil millones de parámetros activos para los desarrolladores.

2026-08-16

← PreviousPage 1 / 10 · 114 articlesNext →