SevenTnewS

Evaluaciones de IA

19 published articles

Laboratorios e Investigación1 min read

Análisis

Puntos de referencia, no gangas: los laboratorios de IA de China alcanzan la paridad

Los laboratorios chinos de IA Qwen, DeepSeek, MiniMax y Kimi han igualado o superado a los modelos frontera de EE.UU. en benchmarks de razonamiento, codificación y análisis de documentos. Con precios agresivos y estrategias de pesos abiertos, ya no son solo alternativas baratas, son competidores reales.

2026-07-27

LLMs y ModelosFeatured3 min read

IA de Código Abierto

Kimi K3 es el modelo abierto más grande jamás creado. Pero aún no es el mejor.

Kimi K3 es el modelo abierto más grande con 2,8 billones de parámetros, pero no logra superar a los mejores modelos propietarios en los benchmarks generales. Si bien sobresale en tareas específicas de codificación y agentivas, la brecha con los líderes de frontera como Claude Fable 5 y GPT 5.6 Sol expone los límites del escalado sin avances arquitectónicos y de datos.

2026-07-27

IA4 min read

Inteligencia Artificial

Cuatro agentes son mejores que uno: ARCANA resuelve ARC-AGI-2 hablando consigo mismo

Investigadores de múltiples instituciones proponen ARCANA, un sistema multiagente que descompone los rompecabezas de ARC-AGI-2 en percepción, generación de hipótesis, ejecución simbólica y refinamiento reflexivo. Su arquitectura modular y un metacontrolador aprendido mejoran la eficiencia del razonamiento, pero el artículo deja preguntas clave sobre la generalización y el costo computacional sin responder.

2026-07-19

IA1 min read

Orchestrator swap

Perplexity convierte a Grok 4.5 en su modelo orquestador estrella en Computer, superando a Opus 4.8 a la mitad del costo

Perplexity afirma que Grok 4.5 superó a otras cinco configuraciones de orquestador en su benchmark interno WANDR, superando a Claude Opus 4.8 en precisión a aproximadamente la mitad del costo, y ya está disponible en Computer para suscriptores Pro y Max.

2026-07-14

IAFeatured1 min read

Benchmark integrity

GPT-5.6 Sol (max) encabeza CritPt, un nuevo punto de referencia de problemas de investigación en física no publicados

GPT-5.6 Sol (max) lidera CritPt, un nuevo punto de referencia de física basado en problemas de investigación de nivel de posgrado no publicados, obteniendo aproximadamente 5 puntos por encima de GPT-5.5 y 4 puntos por delante de Claude Fable 5, según pruebas independientes de Artificial Analysis.

2026-07-13

VibeCoding7 min read

Despliegue de IA de frontera

Claude Fable 5 y Mythos 5: El futuro de la IA es la inteligencia controlada por acceso

El Claude Fable 5 de Anthropic lleva la capacidad de clase Mythos a los usuarios públicos, mientras que Mythos 5 sigue siendo solo de acceso confiable. El modelo de despliegue, enrutamiento de capacidad, clasificadores de respaldo y acceso por niveles, representa un cambio fundamental en la forma en que se lanza y utiliza la IA de frontera.

2026-07-10

IA4 min read

Inteligencia Artificial

Ifbench: el nuevo benchmark que evalúa el seguimiento de instrucciones en IA

IFBench mide la capacidad de los modelos de lenguaje para seguir instrucciones precisas en lenguaje natural, una habilidad clave pero a menudo ignorada. Los primeros resultados muestran a los modelos Grok de xAI liderando, mientras que los modelos Claude quedan rezagados a pesar de sus altos puntajes generales de inteligencia.

2026-07-07

← PreviousPage 5 / 2 · 19 articlesNext →