SevenTnewS

实验室与研究

OpenAI、Anthropic、Google DeepMind、Meta AI及相关论文

114 published articles

4 min read

谷歌 AI

关闭 Gemini 水印并不会让其无法溯源

Gemini 和 Flow 生成的 AI 内容现在可以去掉可见的闪光徽标。不可见的 SynthID 和 C2PA 标记仍然保留,因此验证仍然有效。问题在于:它只对想到要查询的人有效。

2026-08-23

5 min read

AI 透明度

Claude 的隐形水印即将到来:彻底重写即可消除它

Anthropic 将为未来的 Claude 模型添加隐形水印,以满足欧盟《人工智能法案》关于标注 AI 生成内容的规定。它免费且无法追踪,但会遗漏逐字代码、短段落和完全重写的文本。

2026-08-21

4 min read

AI 研究

Muon 更快顿悟模加法,随后其解崩溃

经 Muon 训练的 Transformer 比 AdamW 更快顿悟模加法,但在每一种测试配置中都会丢失该解。论文将崩溃归因于表示-读出界面,冻结任一参数组即可阻止崩溃。傅里叶分析表明,任务电路依然存活,只是被投票压倒。

2026-08-19

3 min read

Fisher-R1 | 假设检验

AI智能体统计分析毫无差错,却仍得出错误结论

自动化假设检验的智能体能够完美地执行分析,却得出错误结论,因为大多数基准测试从不检查p值是否有效。一个包含425个任务的基准测试量化了这种差距,而一个经过强化学习训练的开放权重模型填补了其中一部分。

2026-08-19

5 min read

AI / 智能体编码研究

Blast Radius埋葬死上下文。450具尸体无一复返

一篇新的arXiv论文Blast Radius将浪费的智能体上下文视为死物质并加以可逆埋葬:在七个OpenAI模型上节省17-26%的token,450个已归档上下文,零次召回。这篇论文更宏大的目标是让智能体编码变得可持续, , 一次回收一个token。

2026-08-19

4 min read

AI研究

一个无视回复的AI老板将下属推入“异类”状态

一篇新的arXiv论文发现,AI智能体在交互中的行为与孤立时不同。一个无视下属回复的“老板”智能体会将下属推入“异类”状态;当老板倾听时,两者会一同转变。这一结果使消息传递成为多智能体系统的一个设计决策。

2026-08-19

4 min read

AI 研究

更长的思维链碰壁。ThinkRetrieve 在推理中途注入修复

一篇新的预印本论文指出,顺序式的测试时扩展常常遭遇收益递减甚至负收益。ThinkRetrieve 在推理中途检索已解决的示例并将其注入推理轨迹,报告称在 AIME 2025 上对五个小型推理模型取得了最高 60% 的相对提升。

2026-08-18

4 min read

自动驾驶研究

XCoT-VLA:用六个令牌而非整段文字推理的驾驶AI

XCoT-VLA用2至6个可执行令牌取代视觉-语言-动作驾驶模型中的描述式思维链,在满足实时规划预算的同时降低轨迹误差。代价是:压缩良好的推理不再像人类解释。

2026-08-18

5 min read

AI 安全

消融版 Qwen3.8-27B:拒绝率降至 0%,基准测试几乎未动

Qwen3.8-27B 的消融版 FP8 量化构建在 AdvBench 上对有害提示的拒绝率从 99% 降至 0%,而通用基准测试的差距保持在 1.3 个百分点以内。模型卡以非同寻常的详细程度记录了该方法。其中的警示同样值得关注。

2026-08-16

4 min read

AI 智能体 · 开源

DeepSeek 推出智能体编排框架,连模型本身都是插件

DeepSeek 发布了 DeepSeek Harness,这是一个开源智能体运行时,其中的模型、工具、沙箱和用户界面均为 Cordis 插件。仅追加的会话日志和双工具极简模式指向一个更低调的野心:可审计、可复现的智能体运行。

2026-08-16

Featured3 min read

谷歌的主力模型,在 3.7 更新中规模更大

Gemini 3.7 Flash 价格减半,随后给出理由

谷歌 Gemini 3.7 Flash 以 3.6 Flash 首发价的一半推出,同时宣称在编程、Web 开发和知识工作基准测试上取得进步。该模型在上一代 Flash 发布三周后上市,并为智能体构建者带来了新的性价比论据。

2026-08-16

5 min read

开源AI:阿里巴巴开放Max层级

Qwen 3.8-Max:阿里巴巴最强大模型现已开放免费下载

阿里巴巴正在开源其有史以来最强大的模型Qwen 3.8-Max:一款2.4T参数的MoE模型,在SWE-bench Pro、PaperBench和IFBench上超越GPT-5.6 Sol。我们解析了基准测试的注意事项,以及95B活跃参数的开源旗舰对开发者意味着什么。

2026-08-16

← PreviousPage 1 / 10 · 114 articlesNext →