基准测试
20 published articles
谷歌的主力模型,在 3.7 更新中规模更大
Gemini 3.7 Flash 价格减半,随后给出理由
谷歌 Gemini 3.7 Flash 以 3.6 Flash 首发价的一半推出,同时宣称在编程、Web 开发和知识工作基准测试上取得进步。该模型在上一代 Flash 发布三周后上市,并为智能体构建者带来了新的性价比论据。
2026-08-16
人工智能
Grok 4.6 以 61 分与 GPT-5.6 Sol 并列,但分项得分分化明显
xAI 的 Grok 4.6 在 Artificial Analysis 智能指数(由九项基准综合而成)上与 GPT-5.6 Sol 并列 61 分。分项结果并不均衡:在知识工作与多数编程测试上领先,在 DeepSWE 和 Terminal-Bench 上落后。现已登陆 Cursor 和 Grok Build,起价为每百万输入 token 2 美元。
2026-08-13
端侧 AI 智能体
LFM2.5-2.6B:性能超越四倍于自身规模模型的微型智能体
Liquid AI 的 LFM2.5-2.6B 将智能体模型压缩到 2.6B 参数、内存占用低于 2.5 GB,并在所有测试过的指令跟随基准上位居榜首。它在笔记本电脑上运行速度为 220 tokens/秒;编码是唯一明显的短板。
2026-08-12
前沿AI
Anthropic 最聪明的 Claude 是你无法使用的那一款
Anthropic 向所有人推出了 Claude Fable 5,并将 Claude Mythos 5 保留给经过审核的合作伙伴。同一模型系列,两扇访问之门。基准测试不如路由机制重要,而路由正是前沿 AI 从今往后的发布方式。
2026-08-03
Messier语料库
957,253条记录无法掩盖差距:AI代理在编程领域猛增,但在企业需要的地方停滞不前
Messier语料库包含957,253条记录,涵盖30个基准,揭示了AI代理进展的不均衡:函数调用已饱和,编程改进最快,而企业工作流滞后。它还表明,严格的全通聚合可能掩盖收益并颠覆排行榜排名。
2026-08-02
开源
OpenForgeRL:无需改动推理框架即可训练AI智能体
OpenForgeRL利用代理和Kubernetes,在不修改推理框架的前提下训练AI智能体。测试中,OpenForgeGUI在网页导航与桌面基准测试上达到了数倍于自身规模模型的表现。
2026-08-01
GUI智能体
阿里巴巴的Qwen-UI-Agent在真实手机上的得分高于沙盒环境
阿里巴巴通义实验室的Qwen-UI-Agent声称取得了最先进的移动端得分(AndroidDaily上97.5%),并在计算机使用结果上与Opus 4.8、Gemini 3.1 Pro和GPT-5.6 Sol相比具备竞争力。其在真实设备基准上的得分高于沙盒得分,而OSWorld-v2上40%的部分进展则是其诚实的极限。
2026-07-31
多智能体工程
Qoder 多智能体实验:错误率降低 60%,但代价是什么?
对阿里云Qoder Experts Mode的分析,该模式将专门的AI智能体部署为协调团队。针对现实世界用例和多智能体复杂性的权衡,对显著减少错误的说法进行了审查。
2026-07-31
AI模型
Macaron-V1-Venti的748B四专家设计击败GPT-5.5和Opus 4.8
来自MindLab Research的Macaron-V1-Venti在个人智能、编码、终端使用和生成式UI的基准测试中领先,采用新颖的混合LoRA架构,使模型保持紧凑同时具备专业性。
2026-07-27
人工智能研究
Kling发布两项基准测试,揭示生成式视频真实水平之低
Kling团队推出MultiRef-Compass和KeyFrame-Compass,这两项基准测试将视频生成模型从文本到视频的任务,拓展到多参考和关键帧条件任务。对八个和九个系统的早期测试显示,在实体绑定、时序保持和密集约束处理方面持续失败。
2026-07-26
网络防御
Sakana AI的Fugu-Cyber在安全基准测试中达到86.9%,但表示原始模型并非答案
Sakana AI发布了Fugu-Cyber,一个在基准测试中与前沿网络模型持平的多代理编排模型。该公司认为,在没有人类专业知识和验证工作流程的情况下,仅靠原始模型访问无法解决企业安全。
2026-07-21
AI基础
为什么AI仍然无法解释自己:一个思考严谨性的框架
谷歌DeepMind的一篇论文引入了一个三部分框架来思考AI中的严谨性:概念性、认知性和操作性。它认为,深度学习的快速发展源于优先考虑性能驱动的迭代而非科学理解,要弥合这些差距需要的不仅仅是更好的基准测试。
2026-07-20