Benchmark de razonamiento financiero
Los LLM conocen las fórmulas contables. FinIndices demuestra que no saben aplicarlas
Los LLM pueden recitar fórmulas contables, pero FinIndices, un benchmark construido sobre estados financieros reales de empresas chinas, demuestra que les cuesta aplicarlas. La precisión de Gemini-3.1-Pro cayó del 70.70% al 38.22% al eliminar las pistas de fórmulas, y la generación de tablas degradó activamente el razonamiento de los modelos.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-08-20 · 4 min de lectura

Retire la hoja de fórmulas y el modelo tropieza. Esa es la forma más directa de leer FinIndices, un nuevo benchmark construido a partir de los estados financieros reales de empresas cotizadas chinas, con informes sin recortar de hasta 32,000 tokens. Con fórmulas explícitas, los LLM potentes manejan razonablemente bien las tareas de un solo indicador. Quite las pistas y las puntuaciones se derrumban. Gemini-3.1-Pro cayó del 70.70% al 38.22% en tareas de tablas, una caída que los autores del estudio atribuyen al "emparejamiento frágil de patrones" más que a una comprensión real de la estructura contable.
FinIndices, publicado en Hugging Face, está diseñado para probar lo que los benchmarks financieros existentes esquivan: si los modelos pueden procesar estados financieros reales de principio a fin en lugar de responder preguntas de opción múltiple sobre tablas recortadas. Ofrece dos tipos de tarea. Single-Index pide un indicador financiero calculado a partir de estados largos y llenos de distractores. Table-Index pide múltiples indicadores a lo largo de múltiples períodos, entregados como HTML estructurado, JSON o una tabla. La segunda tarea existe porque los flujos de trabajo financieros reales terminan en tablas comparativas, no en números sueltos.
El cuello de botella del conocimiento: memorizado, no comprendido
El primer hallazgo del estudio, el cuello de botella del conocimiento, es que los LLM han absorbido fórmulas contables durante el preentrenamiento sin interiorizar cuándo usarlas. La pista está en dónde aparecen los fallos: distinguir pasivos que devengan intereses de los que no devengan intereses al calcular el capital invertido, separar el patrimonio atribuible a la empresa matriz del patrimonio total de los accionistas cuando los intereses minoritarios importan, y emparejar variables de flujo del estado de resultados con variables de stock promedio del balance. Las Normas de Contabilidad Chinas (CAS) añaden sus propias trampas, con partidas como pérdidas por deterioro de crédito y ganancias o pérdidas no operativas que los modelos deben asignar a los indicadores correctos.
Las fórmulas de FinIndices proceden de fuentes autorizadas, incluidas las CAS, manuales de análisis de estados financieros y referencias de finanzas corporativas, y el conjunto de prueba fue auditado manualmente por expertos en la materia para garantizar la validez contable y la corrección numérica. Sin las pistas, la desacumulación temporal falla y aparecen desajustes de calibre entre flujos y stocks. La caída de 32 puntos en las tareas de tablas es el síntoma visible; el estudio lo lee como evidencia de que la competencia financiera a nivel de benchmark suele ser un emparejamiento superficial de patrones.
El cuello de botella estructural: las tablas agotan el razonamiento
El segundo hallazgo es más sorprendente. Los modelos que ejecutan derivaciones aisladas a la perfección retroceden a heurísticas superficiales cuando se les pide completar tablas con múltiples métricas y múltiples períodos. El estudio llama a esto cuello de botella estructural: la estructura de salida es una carga real para la capacidad de razonamiento, no un simple detalle de formato.
Bajo esa presión, los modelos toman columnas adyacentes incorrectas, sustituyen la aritmética literal perezosa por ajustes contables más profundos, mezclan los períodos de reporte y usan mal los saldos iniciales. Cuanto más densa es la salida, peor es el razonamiento. Para los equipos que construyen herramientas que convierten estados financieros en tablas listas para auditoría, ese es el hallazgo que más importa.
La alucinación es el modo de fallo por defecto
FinIndices también incluye casos adversariales en los que los informes requeridos faltan por completo. La respuesta correcta es "información insuficiente", no un número. El modo de fallo que el benchmark está diseñado para detectar es la cifra segura alucinada de todos modos. Para un agente financiero, saber cuándo decir "no puedo saberlo" es todo el trabajo.
El mismo patrón aparece más allá de las finanzas
Las finanzas son un banco de pruebas implacable, pero no el único dominio donde aparece esta división. SDABench, un benchmark orientado a capacidades que abarca seis habilidades de razonamiento científico, encontró que los modelos son sólidos en análisis descriptivo pero se derrumban en tareas inferenciales y causales. Incluso la integridad de pruebas de razonamiento más antiguas ha sido puesta en entredicho: las auditorías de GSM8K, el conjunto de matemáticas de nivel escolar, encontraron tasas de error en sus preguntas de hasta el 42%.
Las puntuaciones altas en preguntas controladas exageran lo que los modelos pueden hacer en el mundo real. FinIndices está diseñado para ser despiadado con esa exageración.
El ajuste fino puede restaurar algo de estructura
El estudio ofrece buenas noticias para quienes construyen modelos. El ajuste fino supervisado produjo ganancias sustanciales sin pistas, +8.54% en Single-Index y +3.82% en Table-Index, según el estudio. La lógica estructurada puede restaurarse parcialmente mediante una alineación centrada en los datos, aunque la pregunta con la que abre el estudio, si los LLM poseen razonamiento estructural genuino o solo emparejamiento de patrones superficial, sigue abierta.
| Resultado | Valor |
|---|---|
| Gemini-3.1-Pro, tareas de tabla con pistas de fórmulas | 70.70% |
| Gemini-3.1-Pro, tareas de tabla sin pistas | 38.22% |
| Ganancia SFT sin pistas, Single-Index | +8.54% |
| Ganancia SFT sin pistas, Table-Index | +3.82% |
Un modelo que solo rinde con la hoja de fórmulas delante no ha aprendido contabilidad; ha aprendido a reconocerla. Para los equipos que lanzan agentes financieros, esa distinción no es académica.
- Fuente : LLMs know accounting formulas. FinIndices shows they can't apply them — 2026-08-05
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.