验证
3 published articles
AI代理4 min read
LLM智能体
回归税:为什么给LLM智能体添加技能可能适得其反
一项新研究表明,给LLM智能体添加程序性技能并不总是有帮助,它可能引入回归现象, , 那些之前无需技能就能解决的任务在添加技能后反而失败。研究确定了三个原因,并认为可靠性更依赖于基础定位和验证,而非技能本身。
2026-08-03
AI代理5 min read
人工智能
为什么你的AI智能体在处理长任务时会失败于工作记忆
一篇学术论文引入了StructAgent,一个以状态为中心的框架,重新构建了数字智能体追踪任务进度的方式。它在OSWorld-Verified基准上使用开源模型达到了最先进水平,并泛化到Minecraft。该研究指出,原始交互历史是长周期任务的瓶颈,并提出结构化状态加验证器支持的工作流作为解决方案。
2026-07-22
人工智能Featured5 min read
AI研究
制约AI智能体的瓶颈不是探索,而是评估
Hugging Face的两篇新论文从相反的方向着手解决同一个核心问题:如何让AI智能体可靠地评估自身行为。AJ-Bench构建了一个针对环境感知型评判智能体的基准测试,而HeavySkill则认为最好的评判者存在于模型参数内部。
2026-07-17