SevenTnewS

AI基准测试

15 published articles

基准与测试Featured2 min read

基准分析

500万次投票,25个Elo分:深入解读无人能撼动的Chatbot Arena排行榜

LMSYS Chatbot Arena通过盲评人类偏好,以Elo量表对模型进行排名,目前近500万张选票将顶级实验室压缩在一个25分区间内。LLM-as-a-Judge方法虽然能扩展此类评估的规模,但其自身存在已记录在案的对冗长和顺序的偏见。

2026-08-02

基准与测试Featured2 min read

基准测试分析

在SWE-bench Verified上,顶尖模型达到96%。在企业私有代码上,它们仅勉强超过23%

SWE-bench Verified让前沿模型看起来接近于解决真实世界的软件工程问题,最高得分超过95%。而在私有企业仓库上运行的SWE-bench Pro,将同样的模型得分降至23%或更低,揭示了Verified得分在多大程度上依赖于公共数据暴露。

2026-08-02

基准与测试Featured2 min read

基准分析

GPQA Diamond 旨在抵御谷歌搜索,前沿模型如今仍突破 95%

GPQA Diamond 的设计旨在让配备搜索工具的人类也无法可靠回答其专家级科学问题。前沿模型如今已达到 89% 至 96% 的正确率,将该基准推向与已退役的 MMLU 相同的饱和状态。

2026-08-01

基准与测试Featured2 min read

基准分析

人类最后的考试以2.7%的得分开场。最佳模型仍无法突破65%

人类最后的考试由CAIS和Scale AI构建,旨在接替MMLU成为最难的通用LLM基准。两年过去了,即使Claude Opus 5领先的64.7%得分也远低于90%的人类专家基线。

2026-07-31

基准与测试Featured2 min read

基准测试分析

HumanEval 衡量了 AI 能否编程,却从未问过代码是否真正工作

HumanEval 的 164 个函数补全问题成了衡量 AI 编码能力的标准测试,但记忆效应及其狭窄的范围在通过基准测试与处理真实代码库之间留下了巨大鸿沟,而 SWE-bench 正是为了揭示这一差距而构建的。

2026-07-30

人工智能Featured3 min read

基准分析

三项AI基准测试在现实性能评估中的错误

MMLU等AI基准测试是模型对比的标准,但近期三起案例显示它们遗漏了关键维度。英伟达的Nemotron-4缺乏独立验证,Celeris-1以速度换准确率,而最佳病原体监测AI仅能完成半数任务。证据表明,我们需要能够衡量实际应用中重要因素的评估框架。

2026-07-29

基准与测试Featured2 min read

基准分析

GSM8K 本应测试小学数学水平,但高达42%的题目存在问题

GSM8K 已成为评估大语言模型算术推理能力的标准测试,但审计发现其题库中的错误率高达42%,这动摇了其分数实际衡量内容的有效性。

2026-07-29

基准与测试Featured2 min read

基准测试分析

MMLU 多年来主导了AI基准测试,然后模型开始精通答案

MMLU定义了一代人工智能基准测试,但训练数据污染和有缺陷的答案密钥促使前沿实验室转向动态替代方案,如HLE和GPQA Diamond。

2026-07-28

实验室与研究1 min read

分析

基准测试,而非廉价:中国AI实验室达到与西方同等水平

中国AI实验室Qwen、DeepSeek、MiniMax和Kimi在推理、编码和文档解析基准测试中已赶上或超越美国前沿模型。通过激进定价和开放权重策略,它们不再只是廉价替代品,而是真正的竞争者。

2026-07-27

大语言模型与模型Featured3 min read

开源AI

Kimi K3 是有史以来最大的开放模型,但仍不是最好的。

Kimi K3是最大的开源模型,拥有2.8T参数,但在整体基准测试中未能击败最好的专有模型。尽管它在特定编码和智能体任务上表现出色,但与Claude Fable 5和GPT 5.6 Sol等前沿领先者的差距暴露了没有架构和数据突破的规模扩展的局限性。

2026-07-27

人工智能4 min read

人工智能

四个智能体胜过一个:ARCANA通过自我对话破解ARC-AGI-2

多家机构的研究人员提出了ARCANA,一个将ARC-AGI-2谜题分解为感知、假设生成、符号执行和反思优化的多智能体系统。其模块化架构和学习型元控制器提升了推理效率,但论文中关于泛化能力和计算成本的关键问题仍未解答。

2026-07-19

人工智能1 min read

Orchestrator swap

Perplexity在Computer中以Grok 4.5作为顶级编排模型,以半价击败Opus 4.8

Perplexity称Grok 4.5在其内部WANDR基准测试中优于其他五种编排配置,在准确率上以约一半的成本超越Claude Opus 4.8,现已在Computer中面向Pro和Max订阅者上线。

2026-07-14

← PreviousPage 1 / 2 · 15 articlesNext →