1 published article
AI 研究
大语言模型通常生成正确但塞满不必要步骤的推理链。一个新的诊断基准和压缩方法表明,当前评估器完全忽略了这种低效性,而人类编写的推理步骤中可能有半数可被压缩。
2026-07-31