基准测试
16 published articles
Messier语料库
957,253条记录无法掩盖差距:AI代理在编程领域猛增,但在企业需要的地方停滞不前
Messier语料库包含957,253条记录,涵盖30个基准,揭示了AI代理进展的不均衡:函数调用已饱和,编程改进最快,而企业工作流滞后。它还表明,严格的全通聚合可能掩盖收益并颠覆排行榜排名。
2026-08-02
开源
OpenForgeRL:无需改动推理框架即可训练AI智能体
OpenForgeRL利用代理和Kubernetes,在不修改推理框架的前提下训练AI智能体。测试中,OpenForgeGUI在网页导航与桌面基准测试上达到了数倍于自身规模模型的表现。
2026-08-01
GUI智能体
阿里巴巴的Qwen-UI-Agent在真实手机上的得分高于沙盒环境
阿里巴巴通义实验室的Qwen-UI-Agent声称取得了最先进的移动端得分(AndroidDaily上97.5%),并在计算机使用结果上与Opus 4.8、Gemini 3.1 Pro和GPT-5.6 Sol相比具备竞争力。其在真实设备基准上的得分高于沙盒得分,而OSWorld-v2上40%的部分进展则是其诚实的极限。
2026-07-31
多智能体工程
Qoder 多智能体实验:错误率降低 60%,但代价是什么?
对阿里云Qoder Experts Mode的分析,该模式将专门的AI智能体部署为协调团队。针对现实世界用例和多智能体复杂性的权衡,对显著减少错误的说法进行了审查。
2026-07-31
AI模型
Macaron-V1-Venti的748B四专家设计击败GPT-5.5和Opus 4.8
来自MindLab Research的Macaron-V1-Venti在个人智能、编码、终端使用和生成式UI的基准测试中领先,采用新颖的混合LoRA架构,使模型保持紧凑同时具备专业性。
2026-07-27
人工智能研究
Kling发布两项基准测试,揭示生成式视频真实水平之低
Kling团队推出MultiRef-Compass和KeyFrame-Compass,这两项基准测试将视频生成模型从文本到视频的任务,拓展到多参考和关键帧条件任务。对八个和九个系统的早期测试显示,在实体绑定、时序保持和密集约束处理方面持续失败。
2026-07-26
网络防御
Sakana AI的Fugu-Cyber在安全基准测试中达到86.9%,但表示原始模型并非答案
Sakana AI发布了Fugu-Cyber,一个在基准测试中与前沿网络模型持平的多代理编排模型。该公司认为,在没有人类专业知识和验证工作流程的情况下,仅靠原始模型访问无法解决企业安全。
2026-07-21
AI基础
为什么AI仍然无法解释自己:一个思考严谨性的框架
谷歌DeepMind的一篇论文引入了一个三部分框架来思考AI中的严谨性:概念性、认知性和操作性。它认为,深度学习的快速发展源于优先考虑性能驱动的迭代而非科学理解,要弥合这些差距需要的不仅仅是更好的基准测试。
2026-07-20
本地AI
无审查模型悖论:拒绝少了,安全也丢了,以及本地AI为何仍然重要
对五个本地运行的无审查大语言模型进行基准测试显示,消融手术将过度拒绝率从44%降至接近零,且不影响推理能力,但同样的编辑将安全拒绝率从41.5%降至9.5%,因为两者依赖于相同的内部方向。运行无审查模型的真正原因可能并非你想象的那样。
2026-07-19
分析
Kimi K3 在哪些基准测试上领先前沿模型?对开放 2.8T 模型的逐项解读
月之暗面推出的 2.8T 参数开源模型 Kimi K3,在大多数通用基准测试上落后于前沿专有模型,但在 SWE Marathon、Terminal-Bench 2.1、BrowseComp 等测试中领先。详细表格揭示了其在 KDA 和 Stable LatentMoE 架构上的投入在哪些方面获得了回报。
2026-07-17
人工智能
Inkling揭示了开源模型市场的新分界线
Inkling是首个公开可用的近万亿参数模型,原生支持音频、图像和文本输入,同时拥有100万token的上下文窗口以及NVFP4量化版本。原始基准测试分数很强,但更具启示性的故事在于,开源生态系统如何从追赶者转变为在技术前沿的积极竞争者,以及Inkling在这一新版图中的位置。
2026-07-15
人工智能
Sonnet 4.6 让 Opus 显得昂贵。这改变了一切。
Anthropic 的 Claude Sonnet 4.6 在关键基准测试中匹配或超越了 Opus 级别的性能,同时保持了与 Sonnet 4.5 相同的定价。早期的开发者偏好数据和客户评价表明,该模型已在实际的智能体和编码任务中取代了更昂贵的替代方案。
2026-07-14