SevenTnewS

财务推理基准

LLM 会背会计公式,FinIndices 却显示它们不会应用

LLM 能够背诵会计公式,但基于中国真实财务报表构建的基准 FinIndices 显示,它们在应用这些公式时颇为吃力。移除公式提示后,Gemini-3.1-Pro 的准确率从 70.70% 跌至 38.22%;生成表格这一动作本身还会明显削弱模型的推理能力。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-08-20 · 阅读需 4 分钟

LLM 会背会计公式,FinIndices 却显示它们不会应用

拿走公式表,模型就会出错。这是解读 FinIndices 最直接的方式。FinIndices 是一个基于中国上市公司真实财务报表构建的新基准,未裁剪的报表最长可达 32,000 个 token。在给出明确公式的情况下,强大的 LLM 能够较好地处理单指标任务;一旦移除提示,得分便会崩溃。Gemini-3.1-Pro 在表格任务上的准确率从 70.70% 跌至 38.22%,论文作者将这一波动归因于“脆弱的模式匹配”,而非对会计结构的真正理解。

FinIndices 发布在 Hugging Face 上,旨在测试现有金融基准回避的问题:模型能否端到端处理真实报表,而不是针对裁剪后的表格回答选择题。它包含两种任务类型。Single-Index 要求从包含大量干扰项的长报表中计算一个财务指标;Table-Index 要求跨多个期间计算多个指标,并以结构化 HTML、JSON 或表格形式输出。第二种任务的存在,是因为真实财务工作流的终点是比较表格,而不是单个数字。

知识瓶颈:记住而非理解

论文的第一个发现, , “知识瓶颈”, , 在于 LLM 在预训练期间吸收了会计公式,却没有内化何时使用它们。明显的迹象是失败出现的位置:在计算投入资本时区分有息负债与无息负债;在少数股东权益重要时,将归属于母公司的权益与股东权益总额区分开来;以及将利润表中的流量变量与资产负债表的平均存量变量相匹配。中国会计准则(CAS)还带来额外的陷阱,例如信用减值损失、营业外收入或支出等项目,模型必须将它们映射到正确的指标上。

FinIndices 中的公式来自权威来源,包括中国会计准则、财务报表分析教材和公司金融参考书,测试集还经过领域专家的人工审核,以确保会计有效性和数字正确性。移除提示后,去累计(de-cumulation)会出现错误,存量与流量口径不匹配的问题也会显现。表格任务上 32 个百分点的下跌是可见的症状;论文将其解读为证据,表明基准层面的财务能力往往只是浅层的模式匹配。

结构瓶颈:表格消耗推理能力

第二个发现更令人意外。能够完美执行孤立推导的模型,在被要求填写多指标、多期间表格时,会退化为浅层启发式策略。论文将其称为“结构瓶颈”:输出结构本身是对推理能力的真实负担,而非事后的格式考量。

在这种压力下,模型会抓取错误的相邻列,用偷懒的字面算术替代更深层的会计调整,混淆报告期间,并误用期初余额。输出越密集,推理就越糟糕。对于正在构建将财务报表转化为可供审计表格的工具的团队来说,这是最要紧的发现。

幻觉是默认的失败模式

FinIndices 还包含对抗性案例,其中所需的报表完全缺失。正确的答案是“信息不足”,而不是一个数字。该基准旨在捕获的失败模式是:模型无论如何都会自信地幻觉出一个数字。对于一个金融智能体来说,知道何时说“我无法判断”就是它的全部工作。

同样的模式也出现在金融之外

金融是一个严苛的试验场,但并非这种分歧出现的唯一领域。SDABench 是一个覆盖六种科学推理技能的能力导向基准,它发现模型在描述性分析上表现强劲,但在推理和因果任务上崩塌。即使是更早的推理测试,其完整性也受到审视:对小学数学习题集 GSM8K 的审计发现,其题目中的错误率高达 42%。

受控问题上的高分夸大了模型在现实世界中的能力,而 FinIndices 的设计初衷就是对这种夸大毫不留情。

微调可以恢复部分结构

论文为模型构建者带来了一些好消息。根据论文,监督微调带来了可观的零提示增益:Single-Index 提升 +8.54%,Table-Index 提升 +3.82%。通过以数据为中心的对齐,结构化逻辑可以得到部分恢复,尽管论文开篇提出的问题, , LLM 是否拥有真正的结构推理,还是只有表面的模式匹配, , 仍然悬而未决。

结果数值
Gemini-3.1-Pro,带公式提示的表格任务70.70%
Gemini-3.1-Pro,无公式提示的表格任务38.22%
SFT 零提示增益,Single-Index+8.54%
SFT 零提示增益,Table-Index+3.82%

一个只有在面前摆着公式表时才能正常表现的模型,并没有学会会计;它只是学会了识别会计。对于正在交付金融智能体的团队来说,这种区别并非学术问题。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。