自主系统
3 published articles
人工智能5 min read
人工智能
部署经验揭示了基准测试无法捕捉的智能代理系统真相
一份关于智能代理系统的新教程凸显了基准测试成功与生产可靠性之间的差距。研究人员分享了处理故障的具体模式,从验证流程到人机协作设计,并借鉴了药物发现和金融领域的案例研究。
2026-07-24
大语言模型与模型4 min read
系统设计 / 大语言模型基础设施
为什么模型路由是系统问题,而非分类问题
在417个智能体任务中,尽管GPT-4.1标价更低,其实际成本却几乎是Sonnet的两倍, , 因为缓存而非基础定价主导了成本。本文深入探讨为何将模型路由视为分类处理时总会失败,以及如何构建同时优化成本、延迟与准确性的路由器。
2026-07-15
人工智能3 min read
研究分析
委托工作流中的AI文档损坏:新压力测试揭示的问题
DELEGATE-52基准测试评估了AI系统在长期委托文档编辑任务中的表现,发现前沿模型在20次迭代后累积语义保真度损失19%, 34%。Python工作流平均退化率低于1%,但研究强调,可靠的长期委托仍是一个未解决的挑战。
2026-07-04