人工智能
人工智能:大语言模型、智能体、扩散模型、计算机视觉、自然语言处理及顶级实验室最新动态。
565 published articles
欧洲的主权AI
Mistral承诺AI主权,而其1GW算力押注暴露了症结
Mistral的主权推进如今有了具体产品:区域锁定端点、有SLA保障的层级,以及从GLM-5.2开始的第三方模型托管。难点在于算力,它依赖于一个承诺联盟和2030年1GW的目标。
2026-08-13
人工智能
Grok 4.6 以 61 分与 GPT-5.6 Sol 并列,但分项得分分化明显
xAI 的 Grok 4.6 在 Artificial Analysis 智能指数(由九项基准综合而成)上与 GPT-5.6 Sol 并列 61 分。分项结果并不均衡:在知识工作与多数编程测试上领先,在 DeepSWE 和 Terminal-Bench 上落后。现已登陆 Cursor 和 Grok Build,起价为每百万输入 token 2 美元。
2026-08-13
开源 AI
Meta 的 30B Muse Glimmer 率先登陆 Apple Silicon,NVIDIA 支持随后跟上
Meta 发布了 Muse Glimmer,一款面向 agent 工作负载的 30B 开放权重多模态模型,Ollama 同一天在 Apple Silicon 上提供了支持。DFlash 使其在 Mac 硬件上快 1.5 到 1.8 倍。NVIDIA 和 AMD 支持将在未来几天内跟进。
2026-08-13
终端安全
'$HOME'陷阱:AI编程代理需要沙箱,而不是'允许?'提示
Qoder的终端沙箱每天拦截近一百条破坏性代理命令。这些拦截背后的案例解释了为什么'允许?'提示会失效:一个名为$HOME的项目文件夹、一次指向/root的清理操作,以及一次险些毁掉整个磁盘的点击。
2026-08-13
AI 安全
OpenAI 暂停 Astra,担忧其可在无人辅助下入侵加固系统
OpenAI 在评估后暂停了其开发中模型 Astra 的内部工作,因为评估结论是,根据其 Preparedness Framework,该公司无法排除“关键网络能力”。该完整门槛描述的是:一个能在无需人工干预的情况下发现加固系统中零日漏洞的模型。
2026-08-13
临床AI
nMAS自动化心力衰竭EHR特征工程,但仅在500名模拟患者上测试
nMAS是一个多智能体流水线,从500份模拟患者记录中生成132个结构化特征和70个按评分标准评分的特征,将留出验证的HFrEF表型识别AUROC从0.895提升至0.963。该预印本尚未在真实患者数据上得到验证。
2026-08-13
Qoder Computer Use
一位不懂 Swift 的工程师交付了 macOS 智能体
一位读不懂 Swift 的工程师,借助 Qoder 的 Computer Use 交付了生产级 macOS 软件。他的做法是:用行为判断代码,让 Agent 自己生成测试,并把每一条经验都保存在文件系统中,确保每一轮都不从零开始。
2026-08-12
视频理解
Gemini 3.6 Flash 能数清状态变化,却漏掉眨眼
一项新的 arXiv 研究表明,视频语言模型在简单的事件记录任务上表现失败。Gemini 3.6 Flash 最多可正确计数 12 个持续性状态变化事件,但对瞬时眨眼没有可靠的计数区间;额外帧推高了准确率,却无法实现忠实的恢复,高计数场景下最终计数正确的比例仅为 0.2%。
2026-08-12
端侧 AI 智能体
LFM2.5-2.6B:性能超越四倍于自身规模模型的微型智能体
Liquid AI 的 LFM2.5-2.6B 将智能体模型压缩到 2.6B 参数、内存占用低于 2.5 GB,并在所有测试过的指令跟随基准上位居榜首。它在笔记本电脑上运行速度为 220 tokens/秒;编码是唯一明显的短板。
2026-08-12
Anthropic / Claude
Anthropic 的伦敦创始人之家现在仅可观看
Anthropic 的 Claude Founder House London 申请已截止,9 月 23 日的直播是唯一剩下的入口。议程显示,该实验室正用内部手册、答疑时间以及“初创公司与 Anthropic 共赢”的宣讲来招揽英国顶尖 AI 创始人。
2026-08-11
AI价格战
一条回复声称,智谱GLM-5.2走红的0.07美元定价已上涨约10倍
智谱GLM-5.2以每百万token 0.07美元的价格走红,发帖者称这一95%的降幅"几乎等于免费。"一条回复称,价格回升10倍是博眼球的花招。从业者补充说,GLM-5.2从未达到前沿水平。
2026-08-10
开源AI
Muse Glimmer:Meta的300亿参数智能体占用不到20GB,无需云端
Meta 开源了 Muse Glimmer,这是一个 30B 智能体模型,可在单块消费级 GPU 上离线运行。量化使其保持在 20 GB 以下,DFlash 草稿模型在 RTX 5090 上带来最高 3.1 倍的解码加速,权重以 Apache 2.0 许可发布在 Hugging Face 上。
2026-08-10