智能体AI
15 published articles
AI路由
对于代理型AI,逐次调用路由是盲点。TRACE-Router提供解决方案。
一种新的路由框架TRACE-Router解决了代理型AI中逐次调用LLM路由与任务级成功指标之间的不匹配,实现了高达8个准确率点的提升和36%的延迟降低。
2026-08-01
微软AI
微软用更便宜的老GPU模型在Excel中媲美GPT-5.6
微软在Excel中的MAI模型以较低成本在常见任务上匹敌GPT-5.6,在Copilot中使用的令牌比竞争对手更少,并在H100和A100 GPU上运行,降低了广泛部署的门槛。
2026-07-29
工业转型
Mistral 不再只是一家模型公司:其工业押注已全面落地
Mistral 不再只是又一家 LLM 供应商。其新的工业工程堆栈、与欧洲主要制造商的合作以及自有数据中心,标志着从横向模型竞争向安全、垂直化关键工作流 AI 的有意转变。
2026-07-19
平台战略
Groq停止兜售速度,转而推出智能体操作系统
Groq于9月23日推出远程MCP支持,并迅速添加Kimi K2-0905和OpenAI的GPT-OSS系列等模型,将其API从快速推理管道转变为完整的智能体编排层。该平台不再仅仅依靠每秒token数来竞争。
2026-07-19
管控型代理研究
英伟达新型AI科学家无需接触患者数据即可工作
英伟达AI技术中心推出NAIS,这是一个受管控的代理研究系统,可在受保护的医院数据上协调端到端生物医学工作流。在一项涉及286,422人的真实世界高血压GWAS部署中,该系统产生了与专家主导分析相当的结果,同时保护了隐私并允许人类监督。
2026-07-19
分析
Kimi K3 在哪些基准测试上领先前沿模型?对开放 2.8T 模型的逐项解读
月之暗面推出的 2.8T 参数开源模型 Kimi K3,在大多数通用基准测试上落后于前沿专有模型,但在 SWE Marathon、Terminal-Bench 2.1、BrowseComp 等测试中领先。详细表格揭示了其在 KDA 和 Stable LatentMoE 架构上的投入在哪些方面获得了回报。
2026-07-17
AI基础设施
英伟达Nemotron 3 Embed暴露了每个AI代理都需支付的隐性税
英伟达发布了Nemotron 3 Embed,一系列开源权重嵌入模型,在实现最先进检索质量的同时降低了下游代理的Token成本。8B变体在RTEB上排名第一;较小的1B模型提供了生产级效率。
2026-07-16
人工智能
Sonnet 4.6 让 Opus 显得昂贵。这改变了一切。
Anthropic 的 Claude Sonnet 4.6 在关键基准测试中匹配或超越了 Opus 级别的性能,同时保持了与 Sonnet 4.5 相同的定价。早期的开发者偏好数据和客户评价表明,该模型已在实际的智能体和编码任务中取代了更昂贵的替代方案。
2026-07-14
模型发布
Anthropic 发布 Claude Sonnet 5:以更低成本开启代理型 AI 新前沿
Anthropic 发布 Claude Sonnet 5,一款拥有 100 万 token 上下文窗口的混合推理模型,承诺以更低成本实现顶级代理性能。该模型在编码、长期运行的代理和企业工作流方面表现出色,并获得了广泛测试和客户认可的支撑。
2026-07-10
AI智能体
微软在智能体AI上的赌注:小模型重在编排而非知识
微软研究院的MagenticLite项目表明,当编排、模型设计和执行环境协同设计时,小模型可以处理复杂的智能体任务。该版本包含MagenticBrain(一个140亿参数的编排器)和Fara1.5(一个计算机使用模型系列,在网络导航基准测试上几乎将先前性能提高了一倍)。
2026-07-09
微软Build 2025
微软新平台为科学家提供受治理的AI智能体工厂
Microsoft Discovery现已正式可用,为科学和工程领域的智能体AI提供受治理的平台。此举表明微软正试图通过内置合规与编排能力,抢占企业研发工作流市场。
2026-07-08
人工智能
MiniMax M3 突破开源权重天花板:CUDA 加速 9.4 倍,全程无需人工干预
MiniMax M3 实现 CUDA 内核加速 9.4 倍,在 BrowseComp 上击败 Opus 4.7,并自主复现了 ICLR 论文。所有能力均以开源权重形式提供。
2026-07-06