LLM智能体
15 published articles
人工智能4 min read
长程推理
新框架帮助AI代理记住五分钟前的操作
PRO-LONG是一个极简框架,帮助LLM代理在长序列操作中保留和检索信息。在ARC-AGI-3基准测试中,它在多个前沿模型上平均提升通过率18个百分点,同时消耗的token比现有框架少4.2到5.8倍。借助Fable 5,它以1,750美元的总推理成本实现了97.4%的best@2得分。
2026-07-24
人工智能Featured3 min read
人工智能研究
避免LLM智能体在生产环境中崩溃的噪声技巧
当前的LLM智能体在现实世界的随机性面前不堪一击。NoisyAgent在训练过程中让它们暴露于受控噪声中,从而提升了鲁棒性和通用基准性能。该论文指出,该领域可能已在无噪声条件上过拟合。
2026-07-17
大语言模型与模型Featured3 min read
AI研究
你的AI代理意外通过了测试。现在有了评估标准。
SkillCoach是一个自我进化的评估标准框架,通过分析技能选择、遵循、组合和反思过程来评估和改进代理的技能使用,提供比仅依赖结果指标更好的监督。
2026-07-06