SevenTnewSAI 与科技新闻,深度解读

AI基准测试

19 published articles

实验室与研究1 min read

分析

基准测试,而非廉价:中国AI实验室达到与西方同等水平

中国AI实验室Qwen、DeepSeek、MiniMax和Kimi在推理、编码和文档解析基准测试中已赶上或超越美国前沿模型。通过激进定价和开放权重策略,它们不再只是廉价替代品,而是真正的竞争者。

2026-07-27

大语言模型与模型Featured3 min read

开源AI

Kimi K3 是有史以来最大的开放模型,但仍不是最好的。

Kimi K3是最大的开源模型,拥有2.8T参数,但在整体基准测试中未能击败最好的专有模型。尽管它在特定编码和智能体任务上表现出色,但与Claude Fable 5和GPT 5.6 Sol等前沿领先者的差距暴露了没有架构和数据突破的规模扩展的局限性。

2026-07-27

人工智能4 min read

人工智能

四个智能体胜过一个:ARCANA通过自我对话破解ARC-AGI-2

多家机构的研究人员提出了ARCANA,一个将ARC-AGI-2谜题分解为感知、假设生成、符号执行和反思优化的多智能体系统。其模块化架构和学习型元控制器提升了推理效率,但论文中关于泛化能力和计算成本的关键问题仍未解答。

2026-07-19

人工智能1 min read

Orchestrator swap

Perplexity在Computer中以Grok 4.5作为顶级编排模型,以半价击败Opus 4.8

Perplexity称Grok 4.5在其内部WANDR基准测试中优于其他五种编排配置,在准确率上以约一半的成本超越Claude Opus 4.8,现已在Computer中面向Pro和Max订阅者上线。

2026-07-14

人工智能Featured1 min read

Benchmark integrity

GPT-5.6 Sol (max) 领跑 CritPt,一个由未发表物理研究问题构成的新基准

GPT-5.6 Sol (max) 在 CritPt, , 一个由未发表的研究生级别研究问题构建的新物理基准测试中领先。根据 Artificial Analysis 的独立测试,其得分比 GPT-5.5 高出约 5 分,比 Claude Fable 5 高出 4 分。

2026-07-13

Vibe编程7 min read

前沿AI部署

Claude Fable 5与Mythos 5:AI的未来是门控智能

Anthropic的Claude Fable 5将Mythos级能力带给公众用户,而Mythos 5仍仅限可信访问。其部署模式, , 能力路由、回退分类器与分层访问, , 标志着前沿AI发布与使用方式的根本性转变。

2026-07-10

人工智能4 min read

人工智能

IFBench:测试AI指令遵循能力的新基准

IFBench衡量语言模型遵循精确自然语言指令的能力,这一能力至关重要但常被忽视。早期结果显示,xAI的Grok模型领先,而Claude模型尽管整体智能评分很高,却在此项测试中表现落后。

2026-07-07

← PreviousPage 2 / 2 · 19 articlesNext →