基准测试
22 published articles
网络防御
Sakana AI的Fugu-Cyber在安全基准测试中达到86.9%,但表示原始模型并非答案
Sakana AI发布了Fugu-Cyber,一个在基准测试中与前沿网络模型持平的多代理编排模型。该公司认为,在没有人类专业知识和验证工作流程的情况下,仅靠原始模型访问无法解决企业安全。
2026-07-21
AI基础
为什么AI仍然无法解释自己:一个思考严谨性的框架
谷歌DeepMind的一篇论文引入了一个三部分框架来思考AI中的严谨性:概念性、认知性和操作性。它认为,深度学习的快速发展源于优先考虑性能驱动的迭代而非科学理解,要弥合这些差距需要的不仅仅是更好的基准测试。
2026-07-20
本地AI
无审查模型悖论:拒绝少了,安全也丢了,以及本地AI为何仍然重要
对五个本地运行的无审查大语言模型进行基准测试显示,消融手术将过度拒绝率从44%降至接近零,且不影响推理能力,但同样的编辑将安全拒绝率从41.5%降至9.5%,因为两者依赖于相同的内部方向。运行无审查模型的真正原因可能并非你想象的那样。
2026-07-19
分析
Kimi K3 在哪些基准测试上领先前沿模型?对开放 2.8T 模型的逐项解读
月之暗面推出的 2.8T 参数开源模型 Kimi K3,在大多数通用基准测试上落后于前沿专有模型,但在 SWE Marathon、Terminal-Bench 2.1、BrowseComp 等测试中领先。详细表格揭示了其在 KDA 和 Stable LatentMoE 架构上的投入在哪些方面获得了回报。
2026-07-17
人工智能
Inkling揭示了开源模型市场的新分界线
Inkling是首个公开可用的近万亿参数模型,原生支持音频、图像和文本输入,同时拥有100万token的上下文窗口以及NVFP4量化版本。原始基准测试分数很强,但更具启示性的故事在于,开源生态系统如何从追赶者转变为在技术前沿的积极竞争者,以及Inkling在这一新版图中的位置。
2026-07-15
人工智能
Sonnet 4.6 让 Opus 显得昂贵。这改变了一切。
Anthropic 的 Claude Sonnet 4.6 在关键基准测试中匹配或超越了 Opus 级别的性能,同时保持了与 Sonnet 4.5 相同的定价。早期的开发者偏好数据和客户评价表明,该模型已在实际的智能体和编码任务中取代了更昂贵的替代方案。
2026-07-14
生成式 AI
Google 的 CO2Jump 在单次生成中融合文本与图像,并实时自我修正
Google 推出 CO2Jump,一种无需训练的联合文本与图像生成采样器。它利用自我修正的马尔可夫跳跃过程,其中每种模态的置信度分数实时指导另一模态的更新,在单次生成中产生连贯的多模态输出。该方法还附带三个用于评估联合生成的新型基准数据集。
2026-07-14
AI 模型发布
Anthropic 发布 Claude Sonnet 5:更具代理能力的模型,定价具有竞争力
Anthropic 发布 Claude Sonnet 5,该模型在编码、工具使用和推理等代理任务上缩小了与 Opus 级模型的差距。定价具有竞争力,今日起通过各计划和 Claude API 提供。
2026-07-10
人工智能
Kimi K2.7 Code更快更便宜,但开源编程撞上了名为GPT-5.5的墙。
月之暗面的Kimi K2.7 Code在长周期编程任务上取得显著进步,令牌浪费减少30%。然而GPT-5.5和Claude Opus 4.8在关键基准测试中仍保持领先,凸显了开源决策在实际应用中的权衡。
2026-07-09
深度解读新鲜预印本
五天前刚发布的论文2606.23050,告诉我们AI的未来走向
一份33页的预印本论文2606.23050,五天前发布,标志着对AI研究的重要贡献。本文解析其方法论、关键发现以及对机器学习和自然语言处理发展轨迹的启示。
2026-07-07