SevenTnewS

基准测试

16 published articles

人工智能5 min read

Messier语料库

957,253条记录无法掩盖差距:AI代理在编程领域猛增,但在企业需要的地方停滞不前

Messier语料库包含957,253条记录,涵盖30个基准,揭示了AI代理进展的不均衡:函数调用已饱和,编程改进最快,而企业工作流滞后。它还表明,严格的全通聚合可能掩盖收益并颠覆排行榜排名。

2026-08-02

开源2 min read

开源

OpenForgeRL:无需改动推理框架即可训练AI智能体

OpenForgeRL利用代理和Kubernetes,在不修改推理框架的前提下训练AI智能体。测试中,OpenForgeGUI在网页导航与桌面基准测试上达到了数倍于自身规模模型的表现。

2026-08-01

AI代理3 min read

GUI智能体

阿里巴巴的Qwen-UI-Agent在真实手机上的得分高于沙盒环境

阿里巴巴通义实验室的Qwen-UI-Agent声称取得了最先进的移动端得分(AndroidDaily上97.5%),并在计算机使用结果上与Opus 4.8、Gemini 3.1 Pro和GPT-5.6 Sol相比具备竞争力。其在真实设备基准上的得分高于沙盒得分,而OSWorld-v2上40%的部分进展则是其诚实的极限。

2026-07-31

AI代理Featured2 min read

多智能体工程

Qoder 多智能体实验:错误率降低 60%,但代价是什么?

对阿里云Qoder Experts Mode的分析,该模式将专门的AI智能体部署为协调团队。针对现实世界用例和多智能体复杂性的权衡,对显著减少错误的说法进行了审查。

2026-07-31

大语言模型与模型Featured3 min read

AI模型

Macaron-V1-Venti的748B四专家设计击败GPT-5.5和Opus 4.8

来自MindLab Research的Macaron-V1-Venti在个人智能、编码、终端使用和生成式UI的基准测试中领先,采用新颖的混合LoRA架构,使模型保持紧凑同时具备专业性。

2026-07-27

实验室Featured3 min read

人工智能研究

Kling发布两项基准测试,揭示生成式视频真实水平之低

Kling团队推出MultiRef-Compass和KeyFrame-Compass,这两项基准测试将视频生成模型从文本到视频的任务,拓展到多参考和关键帧条件任务。对八个和九个系统的早期测试显示,在实体绑定、时序保持和密集约束处理方面持续失败。

2026-07-26

人工智能Featured5 min read

网络防御

Sakana AI的Fugu-Cyber在安全基准测试中达到86.9%,但表示原始模型并非答案

Sakana AI发布了Fugu-Cyber,一个在基准测试中与前沿网络模型持平的多代理编排模型。该公司认为,在没有人类专业知识和验证工作流程的情况下,仅靠原始模型访问无法解决企业安全。

2026-07-21

人工智能Featured5 min read

AI基础

为什么AI仍然无法解释自己:一个思考严谨性的框架

谷歌DeepMind的一篇论文引入了一个三部分框架来思考AI中的严谨性:概念性、认知性和操作性。它认为,深度学习的快速发展源于优先考虑性能驱动的迭代而非科学理解,要弥合这些差距需要的不仅仅是更好的基准测试。

2026-07-20

人工智能Featured5 min read

本地AI

无审查模型悖论:拒绝少了,安全也丢了,以及本地AI为何仍然重要

对五个本地运行的无审查大语言模型进行基准测试显示,消融手术将过度拒绝率从44%降至接近零,且不影响推理能力,但同样的编辑将安全拒绝率从41.5%降至9.5%,因为两者依赖于相同的内部方向。运行无审查模型的真正原因可能并非你想象的那样。

2026-07-19

大语言模型与模型Featured6 min read

分析

Kimi K3 在哪些基准测试上领先前沿模型?对开放 2.8T 模型的逐项解读

月之暗面推出的 2.8T 参数开源模型 Kimi K3,在大多数通用基准测试上落后于前沿专有模型,但在 SWE Marathon、Terminal-Bench 2.1、BrowseComp 等测试中领先。详细表格揭示了其在 KDA 和 Stable LatentMoE 架构上的投入在哪些方面获得了回报。

2026-07-17

大语言模型与模型7 min read

人工智能

Inkling揭示了开源模型市场的新分界线

Inkling是首个公开可用的近万亿参数模型,原生支持音频、图像和文本输入,同时拥有100万token的上下文窗口以及NVFP4量化版本。原始基准测试分数很强,但更具启示性的故事在于,开源生态系统如何从追赶者转变为在技术前沿的积极竞争者,以及Inkling在这一新版图中的位置。

2026-07-15

人工智能5 min read

人工智能

Sonnet 4.6 让 Opus 显得昂贵。这改变了一切。

Anthropic 的 Claude Sonnet 4.6 在关键基准测试中匹配或超越了 Opus 级别的性能,同时保持了与 Sonnet 4.5 相同的定价。早期的开发者偏好数据和客户评价表明,该模型已在实际的智能体和编码任务中取代了更昂贵的替代方案。

2026-07-14

← PreviousPage 1 / 2 · 16 articlesNext →