AI代理
自主代理、多代理工作流与编排
45 published articles
设计工具
Open Design 0.18.0 终结了“这是最新版本吗?”会议
Open Design 0.18.0 推出了带实时只读镜像的共享团队工作区,并允许 Codex 无头调用设计引擎。来自 22 位贡献者的 115 个拉取请求在两天内落地。以下是变更内容及其所契合的智能体工具趋势。
2026-08-21
智能体记忆
TEPA:对AI智能体而言,过时记忆比没有记忆更糟
一篇新的arXiv预印本论文认为,智能体记忆存在可证伪性问题:过时的事实仍可被检索,并污染提示词。其TEPA机制会撤销已被取代的记忆;在漂移测试中,朴素记忆得分低于无记忆(0.210对0.309),而TEPA达到0.950。
2026-08-19
AI智能体
PsychoAgent为AI智能体赋予情感记忆,评分者未发现优势
PsychoAgent为LLM智能体提供独立的情感记忆,使情感上显著、充满冲突的痕迹能够压过仅具主题相关性的痕迹。在三个冲突场景中,它检索到的冲突关键记忆多于两个基线(0.933对0.500和0.667),但五名盲法评分者未发现显著的质量优势。
2026-08-19
智能体编码与提示词膨胀
灾难性记忆:为什么 CLAUDE.md 文件会增长 226% 且永不缩小
一项针对 1,867 个代码仓库的 arXiv 研究发现,CLAUDE.md 等智能体编码指令文件在其生命周期内体积增至三倍,因为一旦指令背后的理由被遗忘,删除一行就可能引发性能回退。作者将其命名为“灾难性记忆”,并表明记录推理过程可将多余指令削减 99.3%。
2026-08-15
AI 研究
停止复制粘贴技能:SkillZip 为臃肿智能体提供免评估修复方案
自进化智能体不断追加修复,直到同一条规则出现在多个分支中。SkillZip 通过寻找最短的忠实结构化解释,在无需评估 rollout 的情况下压缩其技能。一次性模式与 Zip-on-Write 模式,以及摘要中未经证实的内容。
2026-08-15
AI 智能体
当智能体技能适得其反,SkillProx 像梯度下降一样修剪它们
技能本应让智能体更聪明,但它们累积的每一次修复都可能让智能体变得更笨。SkillProx 运行一个受近端梯度启发的正向-反向循环,用于诊断、回滚和删除。结果:相比最强的基于梯度的基线,平均准确率提升 3.0 个百分点。
2026-08-14
终端安全
'$HOME'陷阱:AI编程代理需要沙箱,而不是'允许?'提示
Qoder的终端沙箱每天拦截近一百条破坏性代理命令。这些拦截背后的案例解释了为什么'允许?'提示会失效:一个名为$HOME的项目文件夹、一次指向/root的清理操作,以及一次险些毁掉整个磁盘的点击。
2026-08-13
临床AI
nMAS自动化心力衰竭EHR特征工程,但仅在500名模拟患者上测试
nMAS是一个多智能体流水线,从500份模拟患者记录中生成132个结构化特征和70个按评分标准评分的特征,将留出验证的HFrEF表型识别AUROC从0.895提升至0.963。该预印本尚未在真实患者数据上得到验证。
2026-08-13
Qoder Computer Use
一位不懂 Swift 的工程师交付了 macOS 智能体
一位读不懂 Swift 的工程师,借助 Qoder 的 Computer Use 交付了生产级 macOS 软件。他的做法是:用行为判断代码,让 Agent 自己生成测试,并把每一条经验都保存在文件系统中,确保每一轮都不从零开始。
2026-08-12
AI智能体与DevOps
在Qoder中一句提问,结束40分钟的根因排查
阿里云的STAROps插件将自然语言根因诊断引入Qoder IDE。其演示将P95峰值从不到60毫秒拉到1.9秒,返回置信度为80%的证据链,并以自动创建的合并请求收尾。传统排障需要跨五个平台、耗时40多分钟。
2026-08-09
智能体式 UI
Qoder Canvas:为智能体而非人类构建的设计系统
阿里巴巴 Qoder 团队认为,聊天窗口不是承载复杂智能体输出的合适容器。Qoder Canvas 将设计系统的思路应用于智能体界面,教会智能体构建交互式、感知代码库的工件,而不是一堵堵 Markdown 文本墙。
2026-08-07
AI编程
OpenCode押注token效率取胜,免费新增Ling 3.0 Flash
OpenCode现于Ling 3.0 Flash发布数天后免费提供该inclusionAI模型。此举延续了一项注重成本的策略,押注token效率将赢得AI编程竞赛。
2026-08-07