SevenTnewS

Pruebas de referencia de LLM

5 published articles

Pruebas y Benchmarks5 min read

IA en la Educación

Los tutores de IA sobreayudan por diseño. Un nuevo benchmark lo cuantifica

Un benchmark construido sobre 462 sesiones reales de tutoría encuentra que los tutores de IA tienden por defecto a hacer el trabajo por los estudiantes. La instrucción explícita ayuda, pero los modelos todavía tienen dificultades con la decisión de juicio central: cuándo presionar, cuándo proporcionar andamiaje, cuándo dar un paso atrás.

2026-08-10

Pruebas y Benchmarks5 min read

Agentes de voz

Por qué Grok 4.1 Fast supera a modelos más inteligentes en una llamada telefónica

Las clasificaciones generales eligen los LLM equivocados para las llamadas de voz. La clasificación de 2026 de BenchLM pone la latencia primero: Grok 4.1 Fast responde en 0.54s, mientras que Claude Opus 4.6, el mejor puntuado, necesita 1.78s. Los modelos rápidos se llevan la conversación; los modelos de razonamiento se quedan en las llamadas a herramientas en segundo plano.

2026-08-05

Pruebas y BenchmarksFeatured5 min read

Evaluación de IA

Los antiguos benchmarks de IA se rompieron. Esto es lo que los reemplazó.

Los benchmarks estáticos como MMLU y GSM8K están saturados y contaminados. La industria se ha movido hacia la regeneración dinámica, exámenes a nivel experto y entornos de tareas agénticas para obtener una medida real de la capacidad de la IA.

2026-08-04

IAFeatured4 min read

Carrera de modelos

El ranking de LiveBench es un estudio de rendimientos decrecientes

GPT-5.6 Sol se lleva la corona general en LiveBench con un promedio de 82.4, pero Claude Fable 5 lo sigue por solo 1.6 puntos a casi el triple de costo. La verdadera historia es cómo el grupo inferior se ha reducido.

2026-07-22

Herramientas y Frameworks4 min read

Marcos y Herramientas

El nuevo lenguaje de visualización de Microsoft oculta el código repetitivo para que los agentes de IA dejen de tropezar con gráficos

Microsoft Research presentó Flint, un lenguaje intermedio de visualización que ayuda a los LLM y agentes de IA a crear gráficos pulidos sin tener que codificar manualmente parámetros de bajo nivel como escalas y formato de ejes. En un estudio con tres modelos, Flint superó a la generación directa de Vega-Lite, y ya se usa internamente en Data Formulator.

2026-07-08