SevenTnewS

Puntos de referencia

20 published articles

Google DeepMindFeatured3 min read

El caballo de batalla de Google, más grande en la actualización 3.7

Gemini 3.7 Flash reduce su precio a la mitad y luego lo justifica

El Gemini 3.7 Flash de Google llega a la mitad del precio introductorio del 3.6 Flash mientras afirma mejoras en los puntos de referencia de programación, desarrollo web y trabajo del conocimiento. El lanzamiento se produce tres semanas después del Flash anterior y trae consigo un nuevo argumento de relación precio-rendimiento para desarrolladores de agentes.

2026-08-16

xAI / GrokFeatured4 min read

Inteligencia Artificial

Grok 4.6 empata con GPT-5.6 Sol en 61, pero las puntuaciones por componente se dividen

El Grok 4.6 de xAI empata con GPT-5.6 Sol en 61 en el Artificial Analysis Intelligence Index, un compuesto de nueve benchmarks. El desglose es desigual: victorias en trabajo de conocimiento y en la mayoría de las pruebas de código, pérdidas en DeepSWE y Terminal-Bench. Disponible ahora en Cursor y Grok Build, desde $2 por millón de tokens de entrada.

2026-08-13

LLMs y Modelos4 min read

Agentes de IA on-device

LFM2.5-2.6B: el diminuto agente que deja atrás a modelos cuatro veces más grandes

El LFM2.5-2.6B de Liquid AI comprime un modelo agéntico en 2.6B parámetros y menos de 2,5 GB de memoria, liderando todos los benchmarks de seguimiento de instrucciones en los que fue probado. Corre a 220 tokens/s en un portátil; el código es la única brecha clara.

2026-08-12

Anthropic / Claude5 min read

IA de frontera

El Claude más inteligente de Anthropic es el que no puedes usar

Anthropic lanzó Claude Fable 5 para todos y reservó Claude Mythos 5 para socios verificados. Misma clase de modelo, dos puertas de acceso. Los benchmarks importan menos que el enrutamiento, y el enrutamiento es cómo la IA de frontera se distribuye de aquí en adelante.

2026-08-03

IA5 min read

Corpus Messier

957,253 registros no pueden ocultar la brecha: los agentes de IA avanzan en programación pero se estancan donde las empresas los necesitan

El corpus Messier, con 957,253 registros en 30 puntos de referencia, revela un progreso desigual de los agentes de IA: la llamada a funciones está saturada, la programación mejora más rápido y los flujos de trabajo empresariales se quedan atrás. También muestra que la agregación estricta de aprobación total puede ocultar ganancias y alterar los rankings de las tablas de clasificación.

2026-08-02

Código Abierto2 min read

Código abierto

OpenForgeRL entrena agentes de IA sin tocar sus arneses de inferencia

OpenForgeRL utiliza un proxy y Kubernetes para entrenar agentes de IA sin modificar sus arneses de inferencia. En las pruebas, OpenForgeGUI igualó a modelos varias veces más grandes en navegación web y puntos de referencia de escritorio.

2026-08-01

Agentes de IA3 min read

Agentes GUI

El Qwen-UI-Agent de Alibaba obtiene mejores resultados en teléfonos reales que en sandboxes

El Qwen-UI-Agent de Alibaba Tongyi Lab afirma obtener puntuaciones móviles de última generación (97.5% en AndroidDaily) y resultados competitivos en uso de computadora frente a Opus 4.8, Gemini 3.1 Pro y GPT-5.6 Sol. Su puntuación en el benchmark de dispositivos reales supera la de sandbox, mientras que el progreso parcial del 40% en OSWorld-v2 es el límite honesto.

2026-07-31

Agentes de IAFeatured2 min read

Ingeniería Multiagente

El experimento multiagente de Qoder: 60% menos errores, ¿pero a qué costo?

Un análisis del Qoder Experts Mode de Alibaba Cloud, que despliega agentes de IA especializados como un equipo coordinado. Las afirmaciones de reducción significativa de errores se examinan en función de casos de uso reales y las compensaciones de la complejidad multi-agente.

2026-07-31

LLMs y ModelosFeatured3 min read

Modelos de IA

El diseño de cuatro especialistas de Macaron-V1-Venti con 748B supera a GPT-5.5 y Opus 4.8

Macaron-V1-Venti de MindLab Research lidera las evaluaciones en inteligencia personal, codificación, uso de terminal e IU Generativa, utilizando una novedosa arquitectura Mixture of LoRA que mantiene el modelo compacto a la vez que especializado.

2026-07-27

LaboratorioFeatured3 min read

Investigación en IA

Kling publica dos benchmarks que exponen lo deficiente que es realmente la generación de video

KlingTeam presenta MultiRef-Compass y KeyFrame-Compass, dos benchmarks que llevan a los modelos de generación de video más allá del texto a video y hacia tareas de múltiples referencias y condicionamiento por fotogramas clave. Las pruebas iniciales en ocho y nueve sistemas respectivamente muestran fallos consistentes en la vinculación de entidades, la preservación del orden temporal y el manejo de restricciones densas.

2026-07-26

IAFeatured5 min read

Ciberdefensa

Fugu-Cyber de Sakana AI alcanza 86.9% en pruebas de seguridad, pero advierte que los modelos en bruto no son la solución

Sakana AI lanzó Fugu-Cyber, un modelo de orquestación multiagente que iguala a modelos cibernéticos de frontera en benchmarks. La empresa argumenta que el acceso a modelos en bruto por sí solo no puede arreglar la seguridad empresarial sin experiencia humana y flujos de trabajo de verificación.

2026-07-21

IAFeatured5 min read

Fundamentos de la IA

Por qué la IA aún no puede explicarse a sí misma: un marco para pensar sobre el rigor

Un artículo de Google DeepMind presenta un marco de tres partes para pensar sobre el rigor en la IA: conceptual, epistémico y operativo. Sostiene que el rápido progreso del aprendizaje profundo ha venido de priorizar la iteración impulsada por el rendimiento sobre la comprensión científica, y que cerrar las brechas requerirá algo más que mejores puntos de referencia.

2026-07-20

← PreviousPage 1 / 2 · 20 articlesNext →