自我提升
2 published articles
大语言模型与模型4 min read
研究摘要
结构化推理瓶颈超越提示魔法:LLM归纳任务中的新突破
一种名为“沙漏推理”(Hourglass reasoning)的新方法在归纳、演绎和实施阶段之间强制进行严格的上下文隔离,仅传递一个压缩的符号规则。在ARC-AGI-2上,它将最佳5次的准确率比迭代优化提高了多达14个百分点;在ChipBench Verilog综合任务中,使用GPT-5.5几乎将准确率翻倍。消融实验证实,拓扑结构本身驱动了改进。
2026-07-31
人工智能Featured3 min read
人工智能
能不断自我质疑的小模型,性能碾压10倍大的模型
RefineRL训练小型语言模型,通过一个怀疑态度的智能体和强化学习,迭代地改进它们自己的竞技编程解决方案。使用该方法的40亿参数模型性能优于320亿参数模型,并接近2350亿参数的水平,这表明对于推理任务来说,自我改进而非原始参数规模,可能是一条更强的扩展路径。
2026-07-25