LLM智能体
13 published articles
Fisher-R1 | 假设检验
AI智能体统计分析毫无差错,却仍得出错误结论
自动化假设检验的智能体能够完美地执行分析,却得出错误结论,因为大多数基准测试从不检查p值是否有效。一个包含425个任务的基准测试量化了这种差距,而一个经过强化学习训练的开放权重模型填补了其中一部分。
2026-08-19
AI智能体
PsychoAgent为AI智能体赋予情感记忆,评分者未发现优势
PsychoAgent为LLM智能体提供独立的情感记忆,使情感上显著、充满冲突的痕迹能够压过仅具主题相关性的痕迹。在三个冲突场景中,它检索到的冲突关键记忆多于两个基线(0.933对0.500和0.667),但五名盲法评分者未发现显著的质量优势。
2026-08-19
AI 研究
停止复制粘贴技能:SkillZip 为臃肿智能体提供免评估修复方案
自进化智能体不断追加修复,直到同一条规则出现在多个分支中。SkillZip 通过寻找最短的忠实结构化解释,在无需评估 rollout 的情况下压缩其技能。一次性模式与 Zip-on-Write 模式,以及摘要中未经证实的内容。
2026-08-15
AI 智能体
将标准操作规程视为代码:一种新的堆栈分页运行时将强智能体与弱智能体区分开来
来自香港和中国内地的新研究表明,将SOP编译为可执行的伪代码并在堆栈分页虚拟机上运行,能够清晰地分离出能力强的智能体与脆弱的智能体。该工作得出了一个精确的部署规则:先编译,只有在通过模型级别的纪律检查后才能分页。
2026-08-04
LLM智能体
回归税:为什么给LLM智能体添加技能可能适得其反
一项新研究表明,给LLM智能体添加程序性技能并不总是有帮助,它可能引入回归现象, , 那些之前无需技能就能解决的任务在添加技能后反而失败。研究确定了三个原因,并认为可靠性更依赖于基础定位和验证,而非技能本身。
2026-08-03
人工智能
IDEAgent使研究构思生成效率提升3.89倍
IDEAgent利用谱系、多目标反馈和序列记忆来平衡LLM生成的研究构思的质量与多样性。在8个计算机科学领域的32个主题上测试,其Yield(超过质量阈值的多样化构思)是先前方法的3.89倍。
2026-08-02
工业人工智能
AgentRCA: 零样本根因分析,自解释推理过程
名为AgentRCA的零样本智能体框架利用数字孪生和LLM,无需标注数据即可诊断工厂故障,在完全透明的情况下达到监督级准确率。
2026-08-01
研究
六字诀:干扰、验证、代理, , AI智能体探索与安全的新解法
一种新颖的异质智能体群体架构将发散性探索、运行时安全把关和跨领域知识检索分离为专业角色。干扰者负责生成高熵提案,验证者在工具调用网关处执行硬约束检查,代理者通过对比新颖性检索引入域外类比。执行失败被编译为带签名的约束补丁,称为“疤痕”,供后续世代缓存复用。评估显示,该群体实现了95%的远程目标发现率、零次已执行违规行为,并因疤痕机制节省了15.1%的令牌成本,在资源受限条件下通过信用分配的带宽机制实现了55.9%的成本降低。
2026-07-30
AI研究
工具链进化看起来令人印象深刻,直到你在未见过任务上测试它
自动工具链进化本应让LLM智能体变得更好,但一篇新论文认为,许多报道的收益可能来自对公开测试集的过拟合。在实验中,简单的测试时扩展方法匹配或优于进化,而进化后的工具链在未见过的任务上表现有限。
2026-07-27
研究
后见之明填补了智能体强化学习中的监督鸿沟
SEED(自我进化的同策略蒸馏)允许大语言模型分析自身过去的行为轨迹,以事后视角从中提取可重用的自然语言技能,然后在强化学习过程中将这些经验教训蒸馏回其策略中。结果:更密集、同策略的监督提高了样本效率,并泛化到未见过的任务。
2026-07-25
长程推理
新框架帮助AI代理记住五分钟前的操作
PRO-LONG是一个极简框架,帮助LLM代理在长序列操作中保留和检索信息。在ARC-AGI-3基准测试中,它在多个前沿模型上平均提升通过率18个百分点,同时消耗的token比现有框架少4.2到5.8倍。借助Fable 5,它以1,750美元的总推理成本实现了97.4%的best@2得分。
2026-07-24
人工智能研究
避免LLM智能体在生产环境中崩溃的噪声技巧
当前的LLM智能体在现实世界的随机性面前不堪一击。NoisyAgent在训练过程中让它们暴露于受控噪声中,从而提升了鲁棒性和通用基准性能。该论文指出,该领域可能已在无噪声条件上过拟合。
2026-07-17