Pruebas de referencia de LLM
5 published articles
IA en la Educación
Los tutores de IA sobreayudan por diseño. Un nuevo benchmark lo cuantifica
Un benchmark construido sobre 462 sesiones reales de tutoría encuentra que los tutores de IA tienden por defecto a hacer el trabajo por los estudiantes. La instrucción explícita ayuda, pero los modelos todavía tienen dificultades con la decisión de juicio central: cuándo presionar, cuándo proporcionar andamiaje, cuándo dar un paso atrás.
2026-08-10
Agentes de voz
Por qué Grok 4.1 Fast supera a modelos más inteligentes en una llamada telefónica
Las clasificaciones generales eligen los LLM equivocados para las llamadas de voz. La clasificación de 2026 de BenchLM pone la latencia primero: Grok 4.1 Fast responde en 0.54s, mientras que Claude Opus 4.6, el mejor puntuado, necesita 1.78s. Los modelos rápidos se llevan la conversación; los modelos de razonamiento se quedan en las llamadas a herramientas en segundo plano.
2026-08-05
Evaluación de IA
Los antiguos benchmarks de IA se rompieron. Esto es lo que los reemplazó.
Los benchmarks estáticos como MMLU y GSM8K están saturados y contaminados. La industria se ha movido hacia la regeneración dinámica, exámenes a nivel experto y entornos de tareas agénticas para obtener una medida real de la capacidad de la IA.
2026-08-04
Carrera de modelos
El ranking de LiveBench es un estudio de rendimientos decrecientes
GPT-5.6 Sol se lleva la corona general en LiveBench con un promedio de 82.4, pero Claude Fable 5 lo sigue por solo 1.6 puntos a casi el triple de costo. La verdadera historia es cómo el grupo inferior se ha reducido.
2026-07-22
Marcos y Herramientas
El nuevo lenguaje de visualización de Microsoft oculta el código repetitivo para que los agentes de IA dejen de tropezar con gráficos
Microsoft Research presentó Flint, un lenguaje intermedio de visualización que ayuda a los LLM y agentes de IA a crear gráficos pulidos sin tener que codificar manualmente parámetros de bajo nivel como escalas y formato de ejes. En un estudio con tres modelos, Flint superó a la generación directa de Vega-Lite, y ya se usa internamente en Data Formulator.
2026-07-08