AI代理
自主代理、多代理工作流与编排
45 published articles
AI智能体
Cursor的智能体集群从零重写SQLite:分数相同,账单天差地别
Cursor重新设计的智能体集群仅凭手册就用Rust重建了SQLite,并通过了全部验证套件,将合并冲突从7万多个降到不足1000个。每种模型组合都以截然不同的成本交付了相近的质量,这一差距才是核心。
2026-08-05
网络自主性
多供应商代理网络中的信任盲点得到修复
当供应商B的工具被攻陷时,供应商A的代理会毫不知情地继续使用它。一篇新论文提出了一种带阻尼级联传播的信任状态机,将遏制时间从数小时缩短到近乎实时。
2026-08-04
AI 智能体
Hugging Face 的 Slack 机器人查询生产数据。LLM 永远不会看到密钥
Hugging Face 运行着一个内部 Slack 编码智能体 Moon Bot,它可以查询生产数据库并打开 PR。其安全设计通过 Okta 层级、沙盒化 bash 和本地反向代理在服务端注入密钥,使模型无法触及凭证。
2026-08-04
AI基础设施
让智能体付费容易,让它们值得信赖则不然。
Circle的Agent Stack为智能体经济提供了金融轨道:USDC支付、支出策略和服务注册表。但真正的障碍不是技术,而是治理。没有透明的审计追踪和可编程护栏,自主商务的承诺仍然只是理论。
2026-08-04
AI智能体
扎克伯格的全天候智能体承诺遇上Meta的信任问题
扎克伯格承诺推出面向健康、人际关系和财务的24/7消费级智能体,并称它们是Meta下一波收入浪潮。在WhatsApp的规模上,分发是真实存在的,但信任赤字和缺失的数据生态系统,仍横亘在这一愿景与它所需的数十亿用户之间。
2026-08-03
AI开发
编码代理正离开你的本地机器:阿里云与Mistral转向远程
阿里云Qoder为编码代理引入远程委托功能,让开发者将长时间运行的任务卸载到云端沙箱。该功能与新的知识引擎相结合,使Qoder直接与Mistral的远程代理展开竞争,争夺AI辅助开发与本地终端解耦的赛跑。
2026-08-03
LLM智能体
回归税:为什么给LLM智能体添加技能可能适得其反
一项新研究表明,给LLM智能体添加程序性技能并不总是有帮助,它可能引入回归现象, , 那些之前无需技能就能解决的任务在添加技能后反而失败。研究确定了三个原因,并认为可靠性更依赖于基础定位和验证,而非技能本身。
2026-08-03
AI路由
对于代理型AI,逐次调用路由是盲点。TRACE-Router提供解决方案。
一种新的路由框架TRACE-Router解决了代理型AI中逐次调用LLM路由与任务级成功指标之间的不匹配,实现了高达8个准确率点的提升和36%的延迟降低。
2026-08-01
工业人工智能
AgentRCA: 零样本根因分析,自解释推理过程
名为AgentRCA的零样本智能体框架利用数字孪生和LLM,无需标注数据即可诊断工厂故障,在完全透明的情况下达到监督级准确率。
2026-08-01
深度研究AI
BAAI的新研究智能体不只是搜索更长时间,它还会检查自己的作业
BAAI的AREX智能体使用递归自我改进循环,压缩长研究历史,实现高效的验证驱动型精炼。通过一种新颖的长视野强化学习方法进行训练,它们在BrowseComp、DeepSearchQA和HLE上优于可比基线。
2026-07-31
GUI智能体
阿里巴巴的Qwen-UI-Agent在真实手机上的得分高于沙盒环境
阿里巴巴通义实验室的Qwen-UI-Agent声称取得了最先进的移动端得分(AndroidDaily上97.5%),并在计算机使用结果上与Opus 4.8、Gemini 3.1 Pro和GPT-5.6 Sol相比具备竞争力。其在真实设备基准上的得分高于沙盒得分,而OSWorld-v2上40%的部分进展则是其诚实的极限。
2026-07-31
多智能体工程
Qoder 多智能体实验:错误率降低 60%,但代价是什么?
对阿里云Qoder Experts Mode的分析,该模式将专门的AI智能体部署为协调团队。针对现实世界用例和多智能体复杂性的权衡,对显著减少错误的说法进行了审查。
2026-07-31