代码生成
3 published articles
基准与测试Featured2 min read
基准测试分析
HumanEval 衡量了 AI 能否编程,却从未问过代码是否真正工作
HumanEval 的 164 个函数补全问题成了衡量 AI 编码能力的标准测试,但记忆效应及其狭窄的范围在通过基准测试与处理真实代码库之间留下了巨大鸿沟,而 SWE-bench 正是为了揭示这一差距而构建的。
2026-07-30
AI 开发环境Featured4 min read
AI IDE
Cursor 2.0 让 IDE 成为以智能体为先的环境:开发者变成审核者
Cursor 2.0 引入了专门构建的界面和 Composer 模型,旨在与 AI 智能体协作,而非辅助人类打字员。本篇评测详解了哪些改变、表现如何,以及为何可能重新定义开发者的角色。
2026-07-15
AI代理Featured3 min read
多智能体架构
为什么Qoder给每个AI代理配一个老板
Qoder的专家模式用一个单一的Leader取代了点对点的多智能体消息传递,该Leader异步协调专门的专家。该架构减少了状态爆炸,在四个维度上提高了质量,并在每个任务后提取可复用的技能。
2026-03-11