arXiv
18 published articles
智能体记忆
TEPA:对AI智能体而言,过时记忆比没有记忆更糟
一篇新的arXiv预印本论文认为,智能体记忆存在可证伪性问题:过时的事实仍可被检索,并污染提示词。其TEPA机制会撤销已被取代的记忆;在漂移测试中,朴素记忆得分低于无记忆(0.210对0.309),而TEPA达到0.950。
2026-08-19
测试时扩展
CoBa路由以58.9%更少的token追平best-of-16投票
CoBa,一篇新arXiv论文中提出的计算平衡路由策略,在0.01个百分点内追平best-of-16多数投票,同时将参数加权token削减58.9%。在跨MATH-500、AIME和AMC的3,129次评估中,它还完全胜过单样本解码,不过在预算不受限时,best-of-16仍保持微弱优势。
2026-08-19
AI / 智能体编码研究
Blast Radius埋葬死上下文。450具尸体无一复返
一篇新的arXiv论文Blast Radius将浪费的智能体上下文视为死物质并加以可逆埋葬:在七个OpenAI模型上节省17-26%的token,450个已归档上下文,零次召回。这篇论文更宏大的目标是让智能体编码变得可持续, , 一次回收一个token。
2026-08-19
AI智能体
PsychoAgent为AI智能体赋予情感记忆,评分者未发现优势
PsychoAgent为LLM智能体提供独立的情感记忆,使情感上显著、充满冲突的痕迹能够压过仅具主题相关性的痕迹。在三个冲突场景中,它检索到的冲突关键记忆多于两个基线(0.933对0.500和0.667),但五名盲法评分者未发现显著的质量优势。
2026-08-19
AI研究
一个无视回复的AI老板将下属推入“异类”状态
一篇新的arXiv论文发现,AI智能体在交互中的行为与孤立时不同。一个无视下属回复的“老板”智能体会将下属推入“异类”状态;当老板倾听时,两者会一同转变。这一结果使消息传递成为多智能体系统的一个设计决策。
2026-08-19
AI 研究
更长的思维链碰壁。ThinkRetrieve 在推理中途注入修复
一篇新的预印本论文指出,顺序式的测试时扩展常常遭遇收益递减甚至负收益。ThinkRetrieve 在推理中途检索已解决的示例并将其注入推理轨迹,报告称在 AIME 2025 上对五个小型推理模型取得了最高 60% 的相对提升。
2026-08-18
知识图谱与城市AI
站点不是孤岛:RTSKG如何重构城市交通数据
城市级交通模型往往忽略站点与道路和商业设施之间的关系。RTSKG是发布在arXiv上的知识图谱数据集,它显式地建模这些互动,并报告在店铺推荐和客流预测上的收益。
2026-08-18
AI 研究
停止复制粘贴技能:SkillZip 为臃肿智能体提供免评估修复方案
自进化智能体不断追加修复,直到同一条规则出现在多个分支中。SkillZip 通过寻找最短的忠实结构化解释,在无需评估 rollout 的情况下压缩其技能。一次性模式与 Zip-on-Write 模式,以及摘要中未经证实的内容。
2026-08-15
AI 智能体
当智能体技能适得其反,SkillProx 像梯度下降一样修剪它们
技能本应让智能体更聪明,但它们累积的每一次修复都可能让智能体变得更笨。SkillProx 运行一个受近端梯度启发的正向-反向循环,用于诊断、回滚和删除。结果:相比最强的基于梯度的基线,平均准确率提升 3.0 个百分点。
2026-08-14
视频理解
Gemini 3.6 Flash 能数清状态变化,却漏掉眨眼
一项新的 arXiv 研究表明,视频语言模型在简单的事件记录任务上表现失败。Gemini 3.6 Flash 最多可正确计数 12 个持续性状态变化事件,但对瞬时眨眼没有可靠的计数区间;额外帧推高了准确率,却无法实现忠实的恢复,高计数场景下最终计数正确的比例仅为 0.2%。
2026-08-12
AI安全
Shieldstral:3B参数分类器,胜过规模七倍于己的模型
据2026年7月的一篇arXiv论文,一款3B安全分类器匹敌了体积接近其七倍的文本模型,并在多模态审核上确立了新的最先进水平。诀窍:将审核重新定义为二元问答,基于约5410万个样本进行训练。
2026-08-05
LLM蒸馏
上下文一旦静止,LLM蒸馏便告停滞。这篇论文让它演化
上下文可以将任务偏好带入LLM训练,但一旦蒸馏进学生模型,它们便几乎不再提供监督。北京大学的Flux-OPD让上下文随学生一起移动,并用冲突项为教师修正加权。摘要报告称相较现有OPD范式有所提升,但没有给出数字。
2026-07-31