SevenTnewS

AI编程

6 published articles

人工智能Featured4 min read

AI 模型

Poolside 的 Laguna XS 2.1 在相同硬件下将编程基准测试成绩提升了 5 个点

Poolside 的 Laguna XS 2.1 在保持相同 33B 总参数量-3B 激活量 MoE 架构的同时,将 SWE-bench Multilingual 成绩提升 5.4 个百分点至 63.1%。该版本包含量化检查点、推测解码草稿模型以及 OpenMDW-1.1 许可证,使本地 AI 编程更加实用。

2026-07-21

大语言模型与模型Featured6 min read

分析

Kimi K3 在哪些基准测试上领先前沿模型?对开放 2.8T 模型的逐项解读

月之暗面推出的 2.8T 参数开源模型 Kimi K3,在大多数通用基准测试上落后于前沿专有模型,但在 SWE Marathon、Terminal-Bench 2.1、BrowseComp 等测试中领先。详细表格揭示了其在 KDA 和 Stable LatentMoE 架构上的投入在哪些方面获得了回报。

2026-07-17

人工智能Featured6 min read

基准测试深度解析

GPT-5.6 让AI领域的每一分钱都更有价值

OpenAI 的 GPT-5.6 系列, , Sol、Terra、Luna, , 在编程、网络安全和专业基准测试上带来了最先进的结果,而 token 成本仅为竞争对手的一小部分。多智能体“ultra”模式和分层定价旨在让更多用户能够使用前沿智能,同时分层安全措施应对双重用途风险。

2026-07-09

人工智能3 min read

人工智能

MiniMax M3 突破开源权重天花板:CUDA 加速 9.4 倍,全程无需人工干预

MiniMax M3 实现 CUDA 内核加速 9.4 倍,在 BrowseComp 上击败 Opus 4.7,并自主复现了 ICLR 论文。所有能力均以开源权重形式提供。

2026-07-06

大语言模型与模型1 min read

人工智能

MiniMax 新模型 M2.5 编程基准测试夺冠,价格仅为竞争对手的 5%

MiniMax 的 M2.5 模型在编程基准测试 Multi-SWE-Bench 上夺得榜首,在工作空间任务中超越主流模型,且成本仅为竞争对手的十分之一到二十分之一。模型权重已在 HuggingFace 上开源。

2026-07-04

Anthropic / ClaudeFeatured2 min read

AI 模型

Anthropic 发布 Claude Fable 5:面向长期自主工作的第五代模型

Anthropic 推出 Claude Fable 5,这是第五代模型,可运行智能体数天,应对雄心勃勃的编码项目,并以极少的监督处理复杂的企业工作流程。定价从每百万输入令牌 10 美元起。

2026-07-01