IAFeatured3 min read
Análisis de benchmarks
Lo que tres benchmarks de IA se equivocaron sobre el rendimiento real
Los benchmarks de IA como MMLU son el estándar para comparar modelos, pero tres casos recientes muestran que omiten dimensiones críticas. El Nemotron-4 de Nvidia carece de verificación independiente, Celeris-1 intercambia precisión por velocidad, y el mejor agente de IA para vigilancia de patógenos solo completa la mitad de las tareas. La evidencia apunta a la necesidad de marcos de evaluación que midan lo que realmente importa en la práctica.
2026-07-29