SevenTnewS

Benchmark

El abismo entre los LLM y el método científico: un nuevo benchmark revela que los modelos pueden describir datos pero no razonar a través de ellos

SDABench, un nuevo benchmark orientado a capacidades que abarca seis habilidades fundamentales de razonamiento científico y cinco dominios, evalúa 15 LLM y descubre que los modelos son sólidos en el análisis descriptivo, pero fallan en tareas inferenciales y causales. El artículo proporciona un marco de análisis de errores de cinco etapas para localizar fallos.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-07-25 · 4 min de lectura

El abismo entre los LLM y el método científico: un nuevo benchmark revela que los modelos pueden describir datos pero no razonar a través de ellos
Fuentes : arXiv:2607.1107…

Los grandes modelos de lenguaje han sido celebrados por su capacidad para escribir código, resumir literatura e incluso generar flujos de trabajo científicos de apariencia plausible. Pero un nuevo artículo, publicado en arXiv el 13 de julio de 2026, sostiene que el listón para el descubrimiento científico es mucho más alto y que los benchmarks actuales han estado midiendo lo incorrecto.

SDABench, presentado por investigadores liderados por Chuhan Shi y Xiaoquan Ren, reorganiza la evaluación en torno a seis capacidades distintas: descriptiva, exploratoria, inferencial, predictiva, causal y mecanicista. En lugar de recompensar a los modelos por unir un flujo de trabajo que termina con un número correcto, el benchmark prueba si los modelos entienden qué método analítico se ajusta a la pregunta, si pueden modelar variables no observadas y si pueden razonar sobre la causalidad, no solo sobre la correlación.

El benchmark contiene 527 instancias de datos reales (SDA-Real) y 6,000 instancias sintéticas (SDA-Synth), cada una en formatos de opción múltiple y de respuesta abierta, construidas a través de un pipeline automatizado. Los dominios abarcan Biología, Química, Medio Ambiente, Geografía y Física.

Dominio descriptivo, colapso inferencial

Cuando los investigadores evaluaron 15 LLM representativos, el patrón fue evidente. Los modelos manejaron el análisis descriptivo, tareas como resumir medias, varianzas y distribuciones, con un rendimiento sólido. Pero tan pronto como la tarea exigía selección de supuestos, modelado de procesos latentes o razonamiento mecanicista, el rendimiento se degradaba drásticamente.

"Los modelos manejan bien el análisis descriptivo, pero se degradan drásticamente en tareas que requieren selección de supuestos, modelado de procesos latentes o razonamiento mecanicista", escriben los autores. Esto sugiere que los LLM están actualmente mejor adaptados para ser asistentes de datos que científicos autónomos.

Un marco de análisis de errores de cinco etapas

Una de las contribuciones más útiles de SDABench puede ser su marco de análisis de errores de cinco etapas, que identifica exactamente dónde fallan los LLM. Las etapas son: identificación del alcance, identificación de variables, selección del procedimiento, modelado de relaciones y extracción de conclusiones.

Los hallazgos son matizados. Los modelos más avanzados, como las variantes más recientes de OpenAI, Google DeepMind y Anthropic, identifican de manera fiable el alcance y las variables relevantes para una pregunta científica. Pero aún tienen dificultades para seleccionar procedimientos analíticos apropiados, modelar las relaciones entre variables y extraer conclusiones válidas que se alineen con los supuestos del método elegido.

Esta no es una simple historia de escalado: lanzar más parámetros al problema no soluciona la brecha fundamental entre el reconocimiento de patrones y el razonamiento científico.

Lo que el benchmark revela sobre la ciencia de la IA

La investigación tiene implicaciones inmediatas para el creciente campo de los "científicos de IA", sistemas automatizados que afirman llevar a cabo revisiones bibliográficas de principio a fin, generación de hipótesis, experimentación y redacción de artículos. El trabajo de Shi y Ren sugiere que estos sistemas pueden producir resultados de apariencia convincente mientras cometen errores lógicos fundamentales que un revisor humano detectaría.

SDABench también expone un problema más profundo: la confusión entre "ser capaz de generar un resultado" y "comprender el método apropiado". Un modelo que puede escribir código Python para ejecutar una prueba t no necesariamente entiende que una prueba t asume normalidad e independencia, ni puede elegir entre una prueba t y una prueba U de Mann-Whitney basándose en las características de los datos.

Más allá de la correlación hacia la causalidad

El enfoque del artículo en el razonamiento causal y mecanicista es particularmente oportuno. El año pasado ha visto un aumento del interés en la inferencia causal dentro de la comunidad de IA, pero la mayoría de los benchmarks no prueban explícitamente la capacidad de un modelo para distinguir entre correlación y causalidad. SDABench sí lo hace, y los resultados sugieren que esto sigue siendo una capacidad fronteriza que incluso los modelos de frontera no han conquistado.

El razonamiento mecanicista, la comprensión de los procesos subyacentes que generan datos, es aún más desafiante. Ninguno de los modelos evaluados se desempeñó bien en este eje.

Implicaciones para el futuro de la IA en la ciencia

SDABench no argumenta que los LLM sean inútiles para la ciencia. Por el contrario, proporciona una herramienta de diagnóstico detallada que puede guiar el desarrollo. Un investigador que diseñe un LLM científico mejor ahora puede apuntar a tipos de error específicos, como la selección de procedimientos o el modelado de relaciones, y rastrear las mejoras.

El artículo también plantea una pregunta crítica para la comunidad de seguridad y alineación de la IA: si un agente no puede seleccionar de manera fiable la prueba estadística correcta o razonar sobre causa y efecto, ¿debería permitírsele diseñar experimentos de forma autónoma o extraer conclusiones de los datos? El benchmark proporciona un banco de pruebas concreto para responder a esa pregunta.

A medida que el campo del descubrimiento científico impulsado por IA madura, SDABench ofrece una medida rigurosa y multidimensional del progreso, y un recordatorio aleccionador de que describir un conjunto de datos no es lo mismo que entenderlo.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.