Puntos de referencia
20 published articles
El caballo de batalla de Google, más grande en la actualización 3.7
Gemini 3.7 Flash reduce su precio a la mitad y luego lo justifica
El Gemini 3.7 Flash de Google llega a la mitad del precio introductorio del 3.6 Flash mientras afirma mejoras en los puntos de referencia de programación, desarrollo web y trabajo del conocimiento. El lanzamiento se produce tres semanas después del Flash anterior y trae consigo un nuevo argumento de relación precio-rendimiento para desarrolladores de agentes.
2026-08-16
Inteligencia Artificial
Grok 4.6 empata con GPT-5.6 Sol en 61, pero las puntuaciones por componente se dividen
El Grok 4.6 de xAI empata con GPT-5.6 Sol en 61 en el Artificial Analysis Intelligence Index, un compuesto de nueve benchmarks. El desglose es desigual: victorias en trabajo de conocimiento y en la mayoría de las pruebas de código, pérdidas en DeepSWE y Terminal-Bench. Disponible ahora en Cursor y Grok Build, desde $2 por millón de tokens de entrada.
2026-08-13
Agentes de IA on-device
LFM2.5-2.6B: el diminuto agente que deja atrás a modelos cuatro veces más grandes
El LFM2.5-2.6B de Liquid AI comprime un modelo agéntico en 2.6B parámetros y menos de 2,5 GB de memoria, liderando todos los benchmarks de seguimiento de instrucciones en los que fue probado. Corre a 220 tokens/s en un portátil; el código es la única brecha clara.
2026-08-12
IA de frontera
El Claude más inteligente de Anthropic es el que no puedes usar
Anthropic lanzó Claude Fable 5 para todos y reservó Claude Mythos 5 para socios verificados. Misma clase de modelo, dos puertas de acceso. Los benchmarks importan menos que el enrutamiento, y el enrutamiento es cómo la IA de frontera se distribuye de aquí en adelante.
2026-08-03
Corpus Messier
957,253 registros no pueden ocultar la brecha: los agentes de IA avanzan en programación pero se estancan donde las empresas los necesitan
El corpus Messier, con 957,253 registros en 30 puntos de referencia, revela un progreso desigual de los agentes de IA: la llamada a funciones está saturada, la programación mejora más rápido y los flujos de trabajo empresariales se quedan atrás. También muestra que la agregación estricta de aprobación total puede ocultar ganancias y alterar los rankings de las tablas de clasificación.
2026-08-02
Código abierto
OpenForgeRL entrena agentes de IA sin tocar sus arneses de inferencia
OpenForgeRL utiliza un proxy y Kubernetes para entrenar agentes de IA sin modificar sus arneses de inferencia. En las pruebas, OpenForgeGUI igualó a modelos varias veces más grandes en navegación web y puntos de referencia de escritorio.
2026-08-01
Agentes GUI
El Qwen-UI-Agent de Alibaba obtiene mejores resultados en teléfonos reales que en sandboxes
El Qwen-UI-Agent de Alibaba Tongyi Lab afirma obtener puntuaciones móviles de última generación (97.5% en AndroidDaily) y resultados competitivos en uso de computadora frente a Opus 4.8, Gemini 3.1 Pro y GPT-5.6 Sol. Su puntuación en el benchmark de dispositivos reales supera la de sandbox, mientras que el progreso parcial del 40% en OSWorld-v2 es el límite honesto.
2026-07-31
Ingeniería Multiagente
El experimento multiagente de Qoder: 60% menos errores, ¿pero a qué costo?
Un análisis del Qoder Experts Mode de Alibaba Cloud, que despliega agentes de IA especializados como un equipo coordinado. Las afirmaciones de reducción significativa de errores se examinan en función de casos de uso reales y las compensaciones de la complejidad multi-agente.
2026-07-31
Modelos de IA
El diseño de cuatro especialistas de Macaron-V1-Venti con 748B supera a GPT-5.5 y Opus 4.8
Macaron-V1-Venti de MindLab Research lidera las evaluaciones en inteligencia personal, codificación, uso de terminal e IU Generativa, utilizando una novedosa arquitectura Mixture of LoRA que mantiene el modelo compacto a la vez que especializado.
2026-07-27
Investigación en IA
Kling publica dos benchmarks que exponen lo deficiente que es realmente la generación de video
KlingTeam presenta MultiRef-Compass y KeyFrame-Compass, dos benchmarks que llevan a los modelos de generación de video más allá del texto a video y hacia tareas de múltiples referencias y condicionamiento por fotogramas clave. Las pruebas iniciales en ocho y nueve sistemas respectivamente muestran fallos consistentes en la vinculación de entidades, la preservación del orden temporal y el manejo de restricciones densas.
2026-07-26
Ciberdefensa
Fugu-Cyber de Sakana AI alcanza 86.9% en pruebas de seguridad, pero advierte que los modelos en bruto no son la solución
Sakana AI lanzó Fugu-Cyber, un modelo de orquestación multiagente que iguala a modelos cibernéticos de frontera en benchmarks. La empresa argumenta que el acceso a modelos en bruto por sí solo no puede arreglar la seguridad empresarial sin experiencia humana y flujos de trabajo de verificación.
2026-07-21
Fundamentos de la IA
Por qué la IA aún no puede explicarse a sí misma: un marco para pensar sobre el rigor
Un artículo de Google DeepMind presenta un marco de tres partes para pensar sobre el rigor en la IA: conceptual, epistémico y operativo. Sostiene que el rápido progreso del aprendizaje profundo ha venido de priorizar la iteración impulsada por el rendimiento sobre la comprensión científica, y que cerrar las brechas requerirá algo más que mejores puntos de referencia.
2026-07-20