Prueba de referencia LLM
4 published articles
Benchmark de razonamiento financiero
Los LLM conocen las fórmulas contables. FinIndices demuestra que no saben aplicarlas
Los LLM pueden recitar fórmulas contables, pero FinIndices, un benchmark construido sobre estados financieros reales de empresas chinas, demuestra que les cuesta aplicarlas. La precisión de Gemini-3.1-Pro cayó del 70.70% al 38.22% al eliminar las pistas de fórmulas, y la generación de tablas degradó activamente el razonamiento de los modelos.
2026-08-20
Investigación en IA
Por qué tu tutor de IA no puede ver cómo las matemáticas se construyen sobre sí mismas
El K12-Bench de la Universidad de Pekín revela que incluso los mejores modelos de lenguaje apenas entienden cómo se conectan los conceptos escolares. Las puntuaciones del 57% y 46% muestran un punto ciego en la capacidad de la IA para manejar cadenas de requisitos previos, taxonomías de conceptos y anclaje visual, habilidades que los tutores reales utilizan a diario.
2026-08-02
Benchmark
El abismo entre los LLM y el método científico: un nuevo benchmark revela que los modelos pueden describir datos pero no razonar a través de ellos
SDABench, un nuevo benchmark orientado a capacidades que abarca seis habilidades fundamentales de razonamiento científico y cinco dominios, evalúa 15 LLM y descubre que los modelos son sólidos en el análisis descriptivo, pero fallan en tareas inferenciales y causales. El artículo proporciona un marco de análisis de errores de cinco etapas para localizar fallos.
2026-07-25
Rendimiento de LLM
Una startup china de generación de video acaba de superar silenciosamente a Claude Opus en programación
El M2.7 de MiniMax obtiene un 56,22% en SWE-Pro, igualando el rendimiento cercano al de Claude Opus, mientras presume de un 97% de adherencia a habilidades en tareas complejas y una edición superior de productividad ofimática. El modelo señala un cambio de la búsqueda de benchmarks a la implementación de agentes en el mundo real.
2026-07-14