AIME 2025
2 published articles
实验室与研究4 min read
AI 研究
更长的思维链碰壁。ThinkRetrieve 在推理中途注入修复
一篇新的预印本论文指出,顺序式的测试时扩展常常遭遇收益递减甚至负收益。ThinkRetrieve 在推理中途检索已解决的示例并将其注入推理轨迹,报告称在 AIME 2025 上对五个小型推理模型取得了最高 60% 的相对提升。
2026-08-18
人工智能4 min read
AI基准测试
GPT-5.4领跑2026年数学基准测试,前沿模型分数趋于饱和
GPT-5.4横扫顶级竞赛数学领域,略微领先竞争对手,但GPT-5.2 Pro各指标持平,GPT-5.3 Codex以更低成本提供几乎相同的分数。真正的差异在于模型在下一代基准测试(如FrontierMath和HMMT Feb 2026)上的表现。
2026-07-01