实验室与研究
OpenAI、Anthropic、Google DeepMind、Meta AI及相关论文
114 published articles
谷歌 AI
关闭 Gemini 水印并不会让其无法溯源
Gemini 和 Flow 生成的 AI 内容现在可以去掉可见的闪光徽标。不可见的 SynthID 和 C2PA 标记仍然保留,因此验证仍然有效。问题在于:它只对想到要查询的人有效。
2026-08-23
AI 透明度
Claude 的隐形水印即将到来:彻底重写即可消除它
Anthropic 将为未来的 Claude 模型添加隐形水印,以满足欧盟《人工智能法案》关于标注 AI 生成内容的规定。它免费且无法追踪,但会遗漏逐字代码、短段落和完全重写的文本。
2026-08-21
AI 研究
Muon 更快顿悟模加法,随后其解崩溃
经 Muon 训练的 Transformer 比 AdamW 更快顿悟模加法,但在每一种测试配置中都会丢失该解。论文将崩溃归因于表示-读出界面,冻结任一参数组即可阻止崩溃。傅里叶分析表明,任务电路依然存活,只是被投票压倒。
2026-08-19
Fisher-R1 | 假设检验
AI智能体统计分析毫无差错,却仍得出错误结论
自动化假设检验的智能体能够完美地执行分析,却得出错误结论,因为大多数基准测试从不检查p值是否有效。一个包含425个任务的基准测试量化了这种差距,而一个经过强化学习训练的开放权重模型填补了其中一部分。
2026-08-19
AI / 智能体编码研究
Blast Radius埋葬死上下文。450具尸体无一复返
一篇新的arXiv论文Blast Radius将浪费的智能体上下文视为死物质并加以可逆埋葬:在七个OpenAI模型上节省17-26%的token,450个已归档上下文,零次召回。这篇论文更宏大的目标是让智能体编码变得可持续, , 一次回收一个token。
2026-08-19
AI研究
一个无视回复的AI老板将下属推入“异类”状态
一篇新的arXiv论文发现,AI智能体在交互中的行为与孤立时不同。一个无视下属回复的“老板”智能体会将下属推入“异类”状态;当老板倾听时,两者会一同转变。这一结果使消息传递成为多智能体系统的一个设计决策。
2026-08-19
AI 研究
更长的思维链碰壁。ThinkRetrieve 在推理中途注入修复
一篇新的预印本论文指出,顺序式的测试时扩展常常遭遇收益递减甚至负收益。ThinkRetrieve 在推理中途检索已解决的示例并将其注入推理轨迹,报告称在 AIME 2025 上对五个小型推理模型取得了最高 60% 的相对提升。
2026-08-18
自动驾驶研究
XCoT-VLA:用六个令牌而非整段文字推理的驾驶AI
XCoT-VLA用2至6个可执行令牌取代视觉-语言-动作驾驶模型中的描述式思维链,在满足实时规划预算的同时降低轨迹误差。代价是:压缩良好的推理不再像人类解释。
2026-08-18
AI 安全
消融版 Qwen3.8-27B:拒绝率降至 0%,基准测试几乎未动
Qwen3.8-27B 的消融版 FP8 量化构建在 AdvBench 上对有害提示的拒绝率从 99% 降至 0%,而通用基准测试的差距保持在 1.3 个百分点以内。模型卡以非同寻常的详细程度记录了该方法。其中的警示同样值得关注。
2026-08-16
AI 智能体 · 开源
DeepSeek 推出智能体编排框架,连模型本身都是插件
DeepSeek 发布了 DeepSeek Harness,这是一个开源智能体运行时,其中的模型、工具、沙箱和用户界面均为 Cordis 插件。仅追加的会话日志和双工具极简模式指向一个更低调的野心:可审计、可复现的智能体运行。
2026-08-16
谷歌的主力模型,在 3.7 更新中规模更大
Gemini 3.7 Flash 价格减半,随后给出理由
谷歌 Gemini 3.7 Flash 以 3.6 Flash 首发价的一半推出,同时宣称在编程、Web 开发和知识工作基准测试上取得进步。该模型在上一代 Flash 发布三周后上市,并为智能体构建者带来了新的性价比论据。
2026-08-16
开源AI:阿里巴巴开放Max层级
Qwen 3.8-Max:阿里巴巴最强大模型现已开放免费下载
阿里巴巴正在开源其有史以来最强大的模型Qwen 3.8-Max:一款2.4T参数的MoE模型,在SWE-bench Pro、PaperBench和IFBench上超越GPT-5.6 Sol。我们解析了基准测试的注意事项,以及95B活跃参数的开源旗舰对开发者意味着什么。
2026-08-16