SevenTnewS

智能体AI

15 published articles

AI代理2 min read

AI路由

对于代理型AI,逐次调用路由是盲点。TRACE-Router提供解决方案。

一种新的路由框架TRACE-Router解决了代理型AI中逐次调用LLM路由与任务级成功指标之间的不匹配,实现了高达8个准确率点的提升和36%的延迟降低。

2026-08-01

AI代理Featured3 min read

微软AI

微软用更便宜的老GPU模型在Excel中媲美GPT-5.6

微软在Excel中的MAI模型以较低成本在常见任务上匹敌GPT-5.6,在Copilot中使用的令牌比竞争对手更少,并在H100和A100 GPU上运行,降低了广泛部署的门槛。

2026-07-29

初创企业4 min read

工业转型

Mistral 不再只是一家模型公司:其工业押注已全面落地

Mistral 不再只是又一家 LLM 供应商。其新的工业工程堆栈、与欧洲主要制造商的合作以及自有数据中心,标志着从横向模型竞争向安全、垂直化关键工作流 AI 的有意转变。

2026-07-19

人工智能4 min read

平台战略

Groq停止兜售速度,转而推出智能体操作系统

Groq于9月23日推出远程MCP支持,并迅速添加Kimi K2-0905和OpenAI的GPT-OSS系列等模型,将其API从快速推理管道转变为完整的智能体编排层。该平台不再仅仅依靠每秒token数来竞争。

2026-07-19

NVIDIA Research5 min read

管控型代理研究

英伟达新型AI科学家无需接触患者数据即可工作

英伟达AI技术中心推出NAIS,这是一个受管控的代理研究系统,可在受保护的医院数据上协调端到端生物医学工作流。在一项涉及286,422人的真实世界高血压GWAS部署中,该系统产生了与专家主导分析相当的结果,同时保护了隐私并允许人类监督。

2026-07-19

大语言模型与模型Featured6 min read

分析

Kimi K3 在哪些基准测试上领先前沿模型?对开放 2.8T 模型的逐项解读

月之暗面推出的 2.8T 参数开源模型 Kimi K3,在大多数通用基准测试上落后于前沿专有模型,但在 SWE Marathon、Terminal-Bench 2.1、BrowseComp 等测试中领先。详细表格揭示了其在 KDA 和 Stable LatentMoE 架构上的投入在哪些方面获得了回报。

2026-07-17

人工智能5 min read

AI基础设施

英伟达Nemotron 3 Embed暴露了每个AI代理都需支付的隐性税

英伟达发布了Nemotron 3 Embed,一系列开源权重嵌入模型,在实现最先进检索质量的同时降低了下游代理的Token成本。8B变体在RTEB上排名第一;较小的1B模型提供了生产级效率。

2026-07-16

人工智能5 min read

人工智能

Sonnet 4.6 让 Opus 显得昂贵。这改变了一切。

Anthropic 的 Claude Sonnet 4.6 在关键基准测试中匹配或超越了 Opus 级别的性能,同时保持了与 Sonnet 4.5 相同的定价。早期的开发者偏好数据和客户评价表明,该模型已在实际的智能体和编码任务中取代了更昂贵的替代方案。

2026-07-14

人工智能3 min read

模型发布

Anthropic 发布 Claude Sonnet 5:以更低成本开启代理型 AI 新前沿

Anthropic 发布 Claude Sonnet 5,一款拥有 100 万 token 上下文窗口的混合推理模型,承诺以更低成本实现顶级代理性能。该模型在编码、长期运行的代理和企业工作流方面表现出色,并获得了广泛测试和客户认可的支撑。

2026-07-10

AI代理Featured4 min read

AI智能体

微软在智能体AI上的赌注:小模型重在编排而非知识

微软研究院的MagenticLite项目表明,当编排、模型设计和执行环境协同设计时,小模型可以处理复杂的智能体任务。该版本包含MagenticBrain(一个140亿参数的编排器)和Fara1.5(一个计算机使用模型系列,在网络导航基准测试上几乎将先前性能提高了一倍)。

2026-07-09

人工智能Featured4 min read

微软Build 2025

微软新平台为科学家提供受治理的AI智能体工厂

Microsoft Discovery现已正式可用,为科学和工程领域的智能体AI提供受治理的平台。此举表明微软正试图通过内置合规与编排能力,抢占企业研发工作流市场。

2026-07-08

人工智能3 min read

人工智能

MiniMax M3 突破开源权重天花板:CUDA 加速 9.4 倍,全程无需人工干预

MiniMax M3 实现 CUDA 内核加速 9.4 倍,在 BrowseComp 上击败 Opus 4.7,并自主复现了 ICLR 论文。所有能力均以开源权重形式提供。

2026-07-06

← PreviousPage 1 / 2 · 15 articlesNext →