SevenTnewS

智能编码代理

9 published articles

实验室与研究5 min read

AI / 智能体编码研究

Blast Radius埋葬死上下文。450具尸体无一复返

一篇新的arXiv论文Blast Radius将浪费的智能体上下文视为死物质并加以可逆埋葬:在七个OpenAI模型上节省17-26%的token,450个已归档上下文,零次召回。这篇论文更宏大的目标是让智能体编码变得可持续, , 一次回收一个token。

2026-08-19

AI代理4 min read

智能体编码与提示词膨胀

灾难性记忆:为什么 CLAUDE.md 文件会增长 226% 且永不缩小

一项针对 1,867 个代码仓库的 arXiv 研究发现,CLAUDE.md 等智能体编码指令文件在其生命周期内体积增至三倍,因为一旦指令背后的理由被遗忘,删除一行就可能引发性能回退。作者将其命名为“灾难性记忆”,并表明记录推理过程可将多余指令削减 99.3%。

2026-08-15

xAI / GrokFeatured4 min read

人工智能

Grok 4.6 以 61 分与 GPT-5.6 Sol 并列,但分项得分分化明显

xAI 的 Grok 4.6 在 Artificial Analysis 智能指数(由九项基准综合而成)上与 GPT-5.6 Sol 并列 61 分。分项结果并不均衡:在知识工作与多数编程测试上领先,在 DeepSWE 和 Terminal-Bench 上落后。现已登陆 Cursor 和 Grok Build,起价为每百万输入 token 2 美元。

2026-08-13

AI 开发环境5 min read

AI集成开发环境

Cursor以₹649印度套餐和模型路由器应对代理成本

Cursor的7月更新新增每月₹649的印度套餐和将请求路由到更便宜模型的Auto模式,同时带来iPhone和iPad上的完整PR审查以及可在Slack中工作的代理。此次发布真正关乎的是控制代理式编码成本。

2026-08-05

Qwen / 阿里巴巴Featured5 min read

开源AI

Qwen3.8-Max 在24小时内独自击败458支人类团队

Qwen3.8-Max在24小时竞赛中独自击败了526支人类团队中的458支,阿里巴巴将于下周开源其权重。到目前为止,每一个数字都是自我报告的,这正是自主性主张值得审视的原因。

2026-08-03

基准与测试Featured2 min read

基准测试分析

在SWE-bench Verified上,顶尖模型达到96%。在企业私有代码上,它们仅勉强超过23%

SWE-bench Verified让前沿模型看起来接近于解决真实世界的软件工程问题,最高得分超过95%。而在私有企业仓库上运行的SWE-bench Pro,将同样的模型得分降至23%或更低,揭示了Verified得分在多大程度上依赖于公共数据暴露。

2026-08-02

AI 开发环境2 min read

产品发布

Cursor的印度计划每月649印度卢比,包含一个为每项任务选择最便宜模型的模型路由器

Cursor Start为印度开发者提供本地化定价和UPI支付,而Cursor Router让团队可以控制每次请求的成本与智能权衡。这两项功能降低了门槛并优化了开支。

2026-08-01

人工智能5 min read

阿里巴巴Qoder

AI代码出bug概率是人工的两倍,Qoder在编码会话中修复

Qoder Security为每次AI编码会话内置一名专职安全工程师,在代码编写的那一刻立即捕获漏洞,而不是等到数天后的部署。

2026-07-30

网络安全Featured4 min read

AI编程安全

AI生成代码的盲点:阿里巴巴如何即时修复

阿里云推出Qoder Security,这是一个会话内代码审查系统,旨在开发期间而非CI阶段捕获漏洞。该平台声称误报减少80%,修复周期缩短至数小时。

2026-07-26