Fundamentos de la IA
Por qué la IA aún no puede explicarse a sí misma: un marco para pensar sobre el rigor
Un artículo de Google DeepMind presenta un marco de tres partes para pensar sobre el rigor en la IA: conceptual, epistémico y operativo. Sostiene que el rápido progreso del aprendizaje profundo ha venido de priorizar la iteración impulsada por el rendimiento sobre la comprensión científica, y que cerrar las brechas requerirá algo más que mejores puntos de referencia.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-07-20 · 6 min de lectura

El término 'rigor' en IA significa cosas diferentes según a quién se le pregunte. Para un matemático, es una prueba. Para un ingeniero, es lo que funciona a escala. Para un filósofo, es definir correctamente los términos.
En un nuevo artículo publicado en arXiv, el investigador de Google DeepMind Timothy Nguyen propone un marco que intenta mantener unidas las tres acepciones. El artículo, El papel del rigor en la inteligencia artificial, divide el rigor en tres categorías: conceptual, epistémica y operativa, y sostiene que el desarrollo desigual de estas categorías explica tanto los avances espectaculares de la IA como sus persistentes puntos ciegos.
Vale la pena leerlo no porque resuelva ningún debate en particular, sino porque nombra la estructura subyacente a muchos de ellos. Las disputas sobre si los LLM entienden el lenguaje, las acusaciones de alquimia, la saturación de los puntos de referencia, los problemas de seguridad, todos se reducen a la misma asimetría: el rigor operativo se ha adelantado mucho a los otros dos.
Tres tipos de rigor, un campo desequilibrado
El rigor conceptual significa claridad sobre los términos fundamentales. Inteligencia, comprensión, razonamiento, estas palabras se usan constantemente en el discurso sobre IA, pero el campo no tiene una definición establecida para ninguna de ellas. Nguyen cataloga las consecuencias. Cuando Geoffrey Hinton dice que los LLM son inteligentes y Yann LeCun dice que no son ni siquiera tan inteligentes como un gato, el desacuerdo es en parte sobre lo que significa la inteligencia. Hinton enfatiza la competencia conductual. LeCun enfatiza el razonamiento y la comprensión del mundo. Están usando la misma palabra para cosas diferentes.
El rigor epistémico se refiere a cómo se produce y valida el conocimiento científico: reproducibilidad, previsibilidad, explicabilidad. Aquí, el aprendizaje profundo tiene un historial mixto. Los experimentos son en principio reproducibles porque todo es software, pero Nguyen señala que la reproducibilidad de los resultados y la reproducibilidad inferencial a menudo se confunden. Pequeñas diferencias en la implementación pueden cambiar las conclusiones. El campo tiene leyes de escalado que predicen la pérdida con presupuestos computacionales más grandes, pero carece de teorías que predigan cuándo un modelo generalizará o fallará. La explicabilidad es aún peor. Las redes neuronales producen características en espacios de alta dimensión que resisten la interpretación. El artículo invoca la conocida crítica de 'alquimia' pero añade un refinamiento útil: lo que hace alquímico al aprendizaje profundo no es solo la comprensión incompleta, sino la ausencia de abstracción jerárquica. En ciencias maduras, puedes localizar preguntas a una escala: subatómica, celular, evolutiva. En el aprendizaje profundo, a menudo no está claro si un fallo observado proviene de neuronas individuales, dinámicas de optimización, datos de entrenamiento o alguna combinación.

El rigor operativo significa hacer que los sistemas funcionen de manera confiable: puntos de referencia, pruebas, procedimientos de seguridad. Aquí es donde el aprendizaje profundo ha invertido más y ha tenido más éxito. Los puntos de referencia convierten el rendimiento en un objetivo de optimización, creando un bucle de retroalimentación estrecho. Los métodos posteriores al entrenamiento, el ajuste fino por instrucciones, RLHF, la ingeniería de indicaciones, moldean el comportamiento del modelo sin requerir una teoría de cómo funciona el modelo. Nguyen llama a esto sustitución: el rigor operativo compensa la falta de garantías epistémicas.
Puntos de referencia como proxies epistémicos
El tratamiento de los puntos de referencia en el artículo es particularmente agudo. Los puntos de referencia funcionan como lo que Nguyen denomina 'proxies epistémicos': un rendimiento sólido en ImageNet o MMLU se toma como evidencia de que un modelo generaliza más allá de esas tareas específicas. Pero deben cumplirse dos condiciones para que esa inferencia sea válida: el modelo no debe haber sido entrenado con los datos del punto de referencia, y debe aprender los conceptos previstos en lugar de correlaciones espurias. Ninguna de las dos condiciones se cumple de manera confiable en la era actual de preentrenamiento masivo y datos web abiertos.
La hipótesis de la lotería de puntos de referencia, pequeños cambios en la selección de tareas pueden invertir las clasificaciones de métodos, recibe una mención. También la ley de Goodhart: una vez que una métrica se convierte en un objetivo de optimización, deja de ser una medida confiable. La sicofanía en los modelos de chat, donde el sistema aprende a estar de acuerdo con el usuario en lugar de ser veraz, es un síntoma.
Progreso sin teoría
La sección más interesante del artículo examina cómo estas tres formas de rigor han moldeado la trayectoria de la IA. El diagnóstico de Nguyen es que la IA exhibe una asimetría estructural: el rigor operativo se ha vuelto dominante, mientras que el rigor conceptual y epistémico se quedan atrás. Esto no es un accidente. Se deriva de dos características del campo.
Primero, la IA tiene un bucle de retroalimentación estrecho entre la evaluación y el desarrollo. Las mismas métricas utilizadas para evaluar los sistemas son los objetivos que esos sistemas están entrenados para optimizar. En física o medicina, no se itera sobre una teoría maximizando una métrica de rendimiento en un punto de referencia. Se prueba la teoría. En IA, la métrica es el objetivo.
Segundo, la IA produce los artefactos que estudia. Cada generación de modelos crea nuevas capacidades y nuevos modos de fallo, expandiendo el dominio que el trabajo conceptual y epistémico posterior debe explicar. Las ciencias naturales estudian objetos que existen independientemente: átomos, organismos, planetas. La IA estudia sus propias creaciones, que siguen cambiando. Esto hace que el progreso científico acumulativo sea más difícil porque el tema sigue moviéndose.
Nguyen se cuida de no presentar esta asimetría como una crisis. Señala que el aprendizaje profundo posee marcos explicativos parciales: leyes de escalado, teoría del núcleo tangente neuronal, resultados de convergencia para métodos de gradiente. Estos proporcionan una comprensión real, aunque limitada. Pero la conclusión del artículo es que cerrar las brechas, particularmente la epistémica, requerirá algo más que mejores puntos de referencia o modelos más grandes. Requerirá desarrollar formas de comprensión científica que puedan mantener el ritmo de lo que la tecnología ya puede hacer.
Lo que el marco deja abierto
El artículo es más diagnóstico que prescriptivo. No propone una definición unificada de inteligencia, ni afirma que tal definición sea posible. Sugiere que los desacuerdos conceptuales pueden al menos hacerse más precisos, lo que sería una mejora con respecto al estado actual. Sobre la explicabilidad, plantea una pregunta más profunda: si las redes neuronales implementan cálculos para los que no existe una descripción comprensible para los humanos, ¿qué cuenta como explicación?
Esa pregunta no es retórica. Nguyen señala que en campos como la neurociencia, las explicaciones operan rutinariamente a nivel conductual: creencias, deseos, intenciones, sin necesidad de rastrear neuronas individuales. No existe una capa de abstracción equivalente para las redes neuronales. No hay una 'teoría de la mente' para un transformador, y no está claro cómo sería una.
El artículo no intenta responder estas preguntas. Traza el territorio. Dado lo a menudo que los investigadores de IA hablan sin entenderse, un mejor mapa es valioso.
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.