SevenTnewS

智能体AI

21 published articles

xAI / Grok4 min read

AI 智能体

Grok Bot 瞄准大多数 AI 未完成的最后 10% 工作

Grok Bot 是 xAI 新推出的智能体产品,运行在专属云端电脑上,可登录你已在使用工具,通过看你操作一次来学习工作流程,并端到端地完成工作。其背后的卖点是:大多数 AI 只做到 90% 就停下了。

2026-08-14

NVIDIA Research4 min read

AI 模型 | NVIDIA Nemotron 3.5 Lightning

为什么 Nemotron 3.5 Lightning 认为大多数智能体步骤不需要大模型

Nvidia 的新开源模型在本地运行,具有 3B 激活参数和 100 万 token 上下文,专为持续运行的智能体打造。Nvidia 声称吞吐量最高可达同类开源模型的 4 倍,任务完成速度快 30%。

2026-08-14

OpenAI3 min read

AI 安全

OpenAI 暂停 Astra,担忧其可在无人辅助下入侵加固系统

OpenAI 在评估后暂停了其开发中模型 Astra 的内部工作,因为评估结论是,根据其 Preparedness Framework,该公司无法排除“关键网络能力”。该完整门槛描述的是:一个能在无需人工干预的情况下发现加固系统中零日漏洞的模型。

2026-08-13

移动4 min read

智能体AI

三星最新折叠屏手机主打智能体,而非铰链

三星第八代折叠屏手机Galaxy Z Fold8 Ultra、Fold8和Flip8于7月22日发布,智能体AI成为主打卖点。硬件传承真实存在;发布会材料推销的是智能体,而不是铰链。

2026-08-11

人工智能3 min read

人工智能

CNIL的人工智能数据保护蓝图:笔记、审计与联盟

CNIL正从指导转向执法,采取一系列协调行动:发布关于代理式人工智能的探索性说明、推出名为PANAME的实用审计工具,并积极参与欧盟及国际数据保护标准的制定。

2026-08-08

基准与测试Featured8 min read

特别报道:AI评估

2026年AI基准测试现状:静态测试的崩溃与替代系统的构建

2026年AI基准测试全景深度巡览:MMLU、GSM8K和HumanEval为何失效,动态基准测试和专家级考试(如HLE和GPQA Diamond)如何取代它们,代理式测试和锯齿形智能测试揭示了什么,以及人类偏好、LLM评判和生成式可观测性如何完善整个评估堆栈。

2026-08-03

AI代理2 min read

AI路由

对于代理型AI,逐次调用路由是盲点。TRACE-Router提供解决方案。

一种新的路由框架TRACE-Router解决了代理型AI中逐次调用LLM路由与任务级成功指标之间的不匹配,实现了高达8个准确率点的提升和36%的延迟降低。

2026-08-01

AI代理Featured3 min read

微软AI

微软用更便宜的老GPU模型在Excel中媲美GPT-5.6

微软在Excel中的MAI模型以较低成本在常见任务上匹敌GPT-5.6,在Copilot中使用的令牌比竞争对手更少,并在H100和A100 GPU上运行,降低了广泛部署的门槛。

2026-07-29

初创企业4 min read

工业转型

Mistral 不再只是一家模型公司:其工业押注已全面落地

Mistral 不再只是又一家 LLM 供应商。其新的工业工程堆栈、与欧洲主要制造商的合作以及自有数据中心,标志着从横向模型竞争向安全、垂直化关键工作流 AI 的有意转变。

2026-07-19

人工智能4 min read

平台战略

Groq停止兜售速度,转而推出智能体操作系统

Groq于9月23日推出远程MCP支持,并迅速添加Kimi K2-0905和OpenAI的GPT-OSS系列等模型,将其API从快速推理管道转变为完整的智能体编排层。该平台不再仅仅依靠每秒token数来竞争。

2026-07-19

NVIDIA Research5 min read

管控型代理研究

英伟达新型AI科学家无需接触患者数据即可工作

英伟达AI技术中心推出NAIS,这是一个受管控的代理研究系统,可在受保护的医院数据上协调端到端生物医学工作流。在一项涉及286,422人的真实世界高血压GWAS部署中,该系统产生了与专家主导分析相当的结果,同时保护了隐私并允许人类监督。

2026-07-19

大语言模型与模型Featured6 min read

分析

Kimi K3 在哪些基准测试上领先前沿模型?对开放 2.8T 模型的逐项解读

月之暗面推出的 2.8T 参数开源模型 Kimi K3,在大多数通用基准测试上落后于前沿专有模型,但在 SWE Marathon、Terminal-Bench 2.1、BrowseComp 等测试中领先。详细表格揭示了其在 KDA 和 Stable LatentMoE 架构上的投入在哪些方面获得了回报。

2026-07-17

← PreviousPage 1 / 2 · 21 articlesNext →