SevenTnewS

编码代理

9 published articles

Google DeepMindFeatured3 min read

谷歌的主力模型,在 3.7 更新中规模更大

Gemini 3.7 Flash 价格减半,随后给出理由

谷歌 Gemini 3.7 Flash 以 3.6 Flash 首发价的一半推出,同时宣称在编程、Web 开发和知识工作基准测试上取得进步。该模型在上一代 Flash 发布三周后上市,并为智能体构建者带来了新的性价比论据。

2026-08-16

人工智能4 min read

多模态 / 开源

Qwen 插件包为你的编码代理装上眼睛、双手和视频记忆

阿里巴巴 Qwen 团队发布了 Qwen-MM-Plugins,这是一个 Apache-2.0 工具包,为编码代理提供原生多模态技能:动态分辨率图像和视频读取、OCR、grounding、ASR、长视频记忆、视频生成,以及通过瘦客户端控制 Blender 和 FreeCAD。一个脚本即可在 Claude Code、Codex、Qoder、OpenClaw、Qwen Code 和 Gemini CLI 中完成安装。

2026-08-15

AI代理7 min read

终端安全

'$HOME'陷阱:AI编程代理需要沙箱,而不是'允许?'提示

Qoder的终端沙箱每天拦截近一百条破坏性代理命令。这些拦截背后的案例解释了为什么'允许?'提示会失效:一个名为$HOME的项目文件夹、一次指向/root的清理操作,以及一次险些毁掉整个磁盘的点击。

2026-08-13

AI 开发环境4 min read

阿里巴巴 / AI IDE

为什么 Qoder 1.0 放弃了单一工作区 IDE

Qoder 1.0 将工作区、执行、产物和交付边界拆分到隔离的工作树中,使并行智能体任务不再相互冲突。阿里巴巴自己的 A/B 数据显示,其作用域限定的内存引擎将输入 token 减少了 40%。

2026-08-04

人工智能5 min read

AI研究

当编码代理失败时,廉价重试优于升级,成本仅为其35%

CodeRescue是一种针对编码代理的恢复路由系统,它利用执行反馈来决定何时使用廉价模型重试,何时升级到昂贵模型。一个共形风险控制层允许操作员在不重新训练的情况下设定成本目标,实现接近完美的解决率,成本仅为始终升级时的35%。

2026-07-25

基准与测试Featured3 min read

代理编程

Grok 4.5 如何在 SWE Marathon 上领先,这对编程代理意味着什么

Grok 4.5 现领跑 SWE Marathon 排行榜,击败 Claude 4 Opus 和 GPT-5。该基准测试真实的软件工程技能:跨真实仓库的 Bug 修复、功能添加与代码理解。这一结果重塑了 AI 编程代理的竞争格局。

2026-07-20

Mistral AI3 min read

AI智能体

Mistral编程智能体将笔记本电脑抛在身后:并行会话,无需紧盯

Mistral正在将编程智能体迁移到云端,通过新的Mistral Medium 3.5模型实现并行、异步任务执行。此次更新在Mistral Vibe和Le Chat中引入了远程智能体,以及用于多步骤任务的Work模式,同时保留了对敏感操作的人工监督。

2026-07-12

人工智能Featured5 min read

智能体基准分析

ProgramBench:最硬核编程测试中,所有公开AI模型得分均为0%

ProgramBench要求AI智能体仅凭二进制文件重构程序,无需源代码或问题描述。所有公开模型均未能完全解决任何任务,暴露出在探测、架构和停止判断方面的弱点。该基准测试是针对编程智能体超越补丁式工作流程的压力测试。

2026-06-29

基准与测试Featured3 min read

性能

Gemma 4 在 Ollama 0.31 中通过多令牌预测实现近 90% 的性能提升

Ollama 0.31 为 Apple Silicon 上的 Gemma 4 引入了多令牌预测,在编码基准测试中实现了近 90% 的令牌生成速度提升。加速来自一个自动调优的草稿模型和一个消除冗余权重读取的自定义 MLX 内核。

2026-06-29