SevenTnewS

LLM智能体

13 published articles

实验室与研究3 min read

Fisher-R1 | 假设检验

AI智能体统计分析毫无差错,却仍得出错误结论

自动化假设检验的智能体能够完美地执行分析,却得出错误结论,因为大多数基准测试从不检查p值是否有效。一个包含425个任务的基准测试量化了这种差距,而一个经过强化学习训练的开放权重模型填补了其中一部分。

2026-08-19

AI代理4 min read

AI智能体

PsychoAgent为AI智能体赋予情感记忆,评分者未发现优势

PsychoAgent为LLM智能体提供独立的情感记忆,使情感上显著、充满冲突的痕迹能够压过仅具主题相关性的痕迹。在三个冲突场景中,它检索到的冲突关键记忆多于两个基线(0.933对0.500和0.667),但五名盲法评分者未发现显著的质量优势。

2026-08-19

AI代理4 min read

AI 研究

停止复制粘贴技能:SkillZip 为臃肿智能体提供免评估修复方案

自进化智能体不断追加修复,直到同一条规则出现在多个分支中。SkillZip 通过寻找最短的忠实结构化解释,在无需评估 rollout 的情况下压缩其技能。一次性模式与 Zip-on-Write 模式,以及摘要中未经证实的内容。

2026-08-15

人工智能5 min read

AI 智能体

将标准操作规程视为代码:一种新的堆栈分页运行时将强智能体与弱智能体区分开来

来自香港和中国内地的新研究表明,将SOP编译为可执行的伪代码并在堆栈分页虚拟机上运行,能够清晰地分离出能力强的智能体与脆弱的智能体。该工作得出了一个精确的部署规则:先编译,只有在通过模型级别的纪律检查后才能分页。

2026-08-04

AI代理4 min read

LLM智能体

回归税:为什么给LLM智能体添加技能可能适得其反

一项新研究表明,给LLM智能体添加程序性技能并不总是有帮助,它可能引入回归现象, , 那些之前无需技能就能解决的任务在添加技能后反而失败。研究确定了三个原因,并认为可靠性更依赖于基础定位和验证,而非技能本身。

2026-08-03

大语言模型与模型3 min read

人工智能

IDEAgent使研究构思生成效率提升3.89倍

IDEAgent利用谱系、多目标反馈和序列记忆来平衡LLM生成的研究构思的质量与多样性。在8个计算机科学领域的32个主题上测试,其Yield(超过质量阈值的多样化构思)是先前方法的3.89倍。

2026-08-02

AI代理3 min read

工业人工智能

AgentRCA: 零样本根因分析,自解释推理过程

名为AgentRCA的零样本智能体框架利用数字孪生和LLM,无需标注数据即可诊断工厂故障,在完全透明的情况下达到监督级准确率。

2026-08-01

人工智能5 min read

研究

六字诀:干扰、验证、代理, , AI智能体探索与安全的新解法

一种新颖的异质智能体群体架构将发散性探索、运行时安全把关和跨领域知识检索分离为专业角色。干扰者负责生成高熵提案,验证者在工具调用网关处执行硬约束检查,代理者通过对比新颖性检索引入域外类比。执行失败被编译为带签名的约束补丁,称为“疤痕”,供后续世代缓存复用。评估显示,该群体实现了95%的远程目标发现率、零次已执行违规行为,并因疤痕机制节省了15.1%的令牌成本,在资源受限条件下通过信用分配的带宽机制实现了55.9%的成本降低。

2026-07-30

工具与框架3 min read

AI研究

工具链进化看起来令人印象深刻,直到你在未见过任务上测试它

自动工具链进化本应让LLM智能体变得更好,但一篇新论文认为,许多报道的收益可能来自对公开测试集的过拟合。在实验中,简单的测试时扩展方法匹配或优于进化,而进化后的工具链在未见过的任务上表现有限。

2026-07-27

大语言模型与模型Featured4 min read

研究

后见之明填补了智能体强化学习中的监督鸿沟

SEED(自我进化的同策略蒸馏)允许大语言模型分析自身过去的行为轨迹,以事后视角从中提取可重用的自然语言技能,然后在强化学习过程中将这些经验教训蒸馏回其策略中。结果:更密集、同策略的监督提高了样本效率,并泛化到未见过的任务。

2026-07-25

人工智能4 min read

长程推理

新框架帮助AI代理记住五分钟前的操作

PRO-LONG是一个极简框架,帮助LLM代理在长序列操作中保留和检索信息。在ARC-AGI-3基准测试中,它在多个前沿模型上平均提升通过率18个百分点,同时消耗的token比现有框架少4.2到5.8倍。借助Fable 5,它以1,750美元的总推理成本实现了97.4%的best@2得分。

2026-07-24

人工智能Featured3 min read

人工智能研究

避免LLM智能体在生产环境中崩溃的噪声技巧

当前的LLM智能体在现实世界的随机性面前不堪一击。NoisyAgent在训练过程中让它们暴露于受控噪声中,从而提升了鲁棒性和通用基准性能。该论文指出,该领域可能已在无噪声条件上过拟合。

2026-07-17

← PreviousPage 1 / 2 · 13 articlesNext →