幻觉
2 published articles
基准与测试4 min read
财务推理基准
LLM 会背会计公式,FinIndices 却显示它们不会应用
LLM 能够背诵会计公式,但基于中国真实财务报表构建的基准 FinIndices 显示,它们在应用这些公式时颇为吃力。移除公式提示后,Gemini-3.1-Pro 的准确率从 70.70% 跌至 38.22%;生成表格这一动作本身还会明显削弱模型的推理能力。
2026-08-20
基准与测试Featured3 min read
基准测试
新基准显示,前沿AI视觉模型在基础感知任务上表现不佳
PerceptionBench通过3000个问题测试十项原子视觉能力。没有前沿模型突破60%,相似的整体分数掩盖了截然不同的弱点分布。
2026-08-03