AI编程
6 published articles
AI 模型
Poolside 的 Laguna XS 2.1 在相同硬件下将编程基准测试成绩提升了 5 个点
Poolside 的 Laguna XS 2.1 在保持相同 33B 总参数量-3B 激活量 MoE 架构的同时,将 SWE-bench Multilingual 成绩提升 5.4 个百分点至 63.1%。该版本包含量化检查点、推测解码草稿模型以及 OpenMDW-1.1 许可证,使本地 AI 编程更加实用。
2026-07-21
分析
Kimi K3 在哪些基准测试上领先前沿模型?对开放 2.8T 模型的逐项解读
月之暗面推出的 2.8T 参数开源模型 Kimi K3,在大多数通用基准测试上落后于前沿专有模型,但在 SWE Marathon、Terminal-Bench 2.1、BrowseComp 等测试中领先。详细表格揭示了其在 KDA 和 Stable LatentMoE 架构上的投入在哪些方面获得了回报。
2026-07-17
基准测试深度解析
GPT-5.6 让AI领域的每一分钱都更有价值
OpenAI 的 GPT-5.6 系列, , Sol、Terra、Luna, , 在编程、网络安全和专业基准测试上带来了最先进的结果,而 token 成本仅为竞争对手的一小部分。多智能体“ultra”模式和分层定价旨在让更多用户能够使用前沿智能,同时分层安全措施应对双重用途风险。
2026-07-09
人工智能
MiniMax M3 突破开源权重天花板:CUDA 加速 9.4 倍,全程无需人工干预
MiniMax M3 实现 CUDA 内核加速 9.4 倍,在 BrowseComp 上击败 Opus 4.7,并自主复现了 ICLR 论文。所有能力均以开源权重形式提供。
2026-07-06
人工智能
MiniMax 新模型 M2.5 编程基准测试夺冠,价格仅为竞争对手的 5%
MiniMax 的 M2.5 模型在编程基准测试 Multi-SWE-Bench 上夺得榜首,在工作空间任务中超越主流模型,且成本仅为竞争对手的十分之一到二十分之一。模型权重已在 HuggingFace 上开源。
2026-07-04
AI 模型
Anthropic 发布 Claude Fable 5:面向长期自主工作的第五代模型
Anthropic 推出 Claude Fable 5,这是第五代模型,可运行智能体数天,应对雄心勃勃的编码项目,并以极少的监督处理复杂的企业工作流程。定价从每百万输入令牌 10 美元起。
2026-07-01