Pruebas y Benchmarks4 min read
Benchmark
El abismo entre los LLM y el método científico: un nuevo benchmark revela que los modelos pueden describir datos pero no razonar a través de ellos
SDABench, un nuevo benchmark orientado a capacidades que abarca seis habilidades fundamentales de razonamiento científico y cinco dominios, evalúa 15 LLM y descubre que los modelos son sólidos en el análisis descriptivo, pero fallan en tareas inferenciales y causales. El artículo proporciona un marco de análisis de errores de cinco etapas para localizar fallos.
2026-07-25