SevenTnewSAI 与科技新闻,深度解读

基准测试

22 published articles

人工智能Featured5 min read

网络防御

Sakana AI的Fugu-Cyber在安全基准测试中达到86.9%,但表示原始模型并非答案

Sakana AI发布了Fugu-Cyber,一个在基准测试中与前沿网络模型持平的多代理编排模型。该公司认为,在没有人类专业知识和验证工作流程的情况下,仅靠原始模型访问无法解决企业安全。

2026-07-21

人工智能Featured5 min read

AI基础

为什么AI仍然无法解释自己:一个思考严谨性的框架

谷歌DeepMind的一篇论文引入了一个三部分框架来思考AI中的严谨性:概念性、认知性和操作性。它认为,深度学习的快速发展源于优先考虑性能驱动的迭代而非科学理解,要弥合这些差距需要的不仅仅是更好的基准测试。

2026-07-20

人工智能Featured5 min read

本地AI

无审查模型悖论:拒绝少了,安全也丢了,以及本地AI为何仍然重要

对五个本地运行的无审查大语言模型进行基准测试显示,消融手术将过度拒绝率从44%降至接近零,且不影响推理能力,但同样的编辑将安全拒绝率从41.5%降至9.5%,因为两者依赖于相同的内部方向。运行无审查模型的真正原因可能并非你想象的那样。

2026-07-19

大语言模型与模型Featured6 min read

分析

Kimi K3 在哪些基准测试上领先前沿模型?对开放 2.8T 模型的逐项解读

月之暗面推出的 2.8T 参数开源模型 Kimi K3,在大多数通用基准测试上落后于前沿专有模型,但在 SWE Marathon、Terminal-Bench 2.1、BrowseComp 等测试中领先。详细表格揭示了其在 KDA 和 Stable LatentMoE 架构上的投入在哪些方面获得了回报。

2026-07-17

大语言模型与模型7 min read

人工智能

Inkling揭示了开源模型市场的新分界线

Inkling是首个公开可用的近万亿参数模型,原生支持音频、图像和文本输入,同时拥有100万token的上下文窗口以及NVFP4量化版本。原始基准测试分数很强,但更具启示性的故事在于,开源生态系统如何从追赶者转变为在技术前沿的积极竞争者,以及Inkling在这一新版图中的位置。

2026-07-15

人工智能5 min read

人工智能

Sonnet 4.6 让 Opus 显得昂贵。这改变了一切。

Anthropic 的 Claude Sonnet 4.6 在关键基准测试中匹配或超越了 Opus 级别的性能,同时保持了与 Sonnet 4.5 相同的定价。早期的开发者偏好数据和客户评价表明,该模型已在实际的智能体和编码任务中取代了更昂贵的替代方案。

2026-07-14

人工智能Featured4 min read

生成式 AI

Google 的 CO2Jump 在单次生成中融合文本与图像,并实时自我修正

Google 推出 CO2Jump,一种无需训练的联合文本与图像生成采样器。它利用自我修正的马尔可夫跳跃过程,其中每种模态的置信度分数实时指导另一模态的更新,在单次生成中产生连贯的多模态输出。该方法还附带三个用于评估联合生成的新型基准数据集。

2026-07-14

Anthropic / ClaudeFeatured4 min read

AI 模型发布

Anthropic 发布 Claude Sonnet 5:更具代理能力的模型,定价具有竞争力

Anthropic 发布 Claude Sonnet 5,该模型在编码、工具使用和推理等代理任务上缩小了与 Opus 级模型的差距。定价具有竞争力,今日起通过各计划和 Claude API 提供。

2026-07-10

人工智能3 min read

人工智能

Kimi K2.7 Code更快更便宜,但开源编程撞上了名为GPT-5.5的墙。

月之暗面的Kimi K2.7 Code在长周期编程任务上取得显著进步,令牌浪费减少30%。然而GPT-5.5和Claude Opus 4.8在关键基准测试中仍保持领先,凸显了开源决策在实际应用中的权衡。

2026-07-09

实验室与研究4 min read

深度解读新鲜预印本

五天前刚发布的论文2606.23050,告诉我们AI的未来走向

一份33页的预印本论文2606.23050,五天前发布,标志着对AI研究的重要贡献。本文解析其方法论、关键发现以及对机器学习和自然语言处理发展轨迹的启示。

2026-07-07

← PreviousPage 2 / 2 · 22 articlesNext →