SevenTnewS

大语言模型

7 published articles

Google DeepMindFeatured3 min read

谷歌的主力模型,在 3.7 更新中规模更大

Gemini 3.7 Flash 价格减半,随后给出理由

谷歌 Gemini 3.7 Flash 以 3.6 Flash 首发价的一半推出,同时宣称在编程、Web 开发和知识工作基准测试上取得进步。该模型在上一代 Flash 发布三周后上市,并为智能体构建者带来了新的性价比论据。

2026-08-16

Qwen / 阿里巴巴4 min read

AI经济学

阿里巴巴18美元套餐在Claude Code中运行Qwen与DeepSeek

阿里云的Token Plan Individual将Qwen及DeepSeek等第三方模型打包进单一积分池,月费6美元起,可在Claude Code和Cursor中使用。该公司声称较按量付费节省约40%,但该计划仅在新加坡可用,且仅限经批准的工具内使用。

2026-08-14

Qwen / 阿里巴巴2 min read

Qwen / 阿里巴巴

Qwen3-2507 发布:思维模型与指令模型分道扬镳,回归专门化路线

阿里巴巴 Qwen 团队发布 Qwen3-2507,将模型系列拆分为专门的指令变体和思维变体。此次更新在推理、指令遵循以及 256K 上下文支持(可扩展至 1M tokens)方面带来了实质性改进。

2026-07-29

人工智能1 min read

AI模型

OpenAI发布针对长上下文处理的小型GPT更新

OpenAI今日推出了一项小型的GPT更新,涉及长上下文管理。此次变更旨在帮助模型更有效地处理扩展输入。

2026-07-28

大语言模型与模型Featured3 min read

AI模型

Claude Opus 5以一半成本达到接近前沿的性能,但在网络安全上故意留出盲点

Claude Opus 5发布,在编码和知识基准测试上获得接近Fable水平的分数,价格却只有一半。但其故意削弱的网络安全能力为开发者带来了明确的取舍。

2026-07-24

人工智能4 min read

《自然·神经科学》论文

微软新方法将黑箱大脑AI转化为可解读理论

GCT将不可解读的基于LLM的脑模型转化为类似“食物准备”或“地点名称”的简短短语,然后利用LLM编写故事,在真实被试中对这些解释进行因果检验。该方法有望弥合预测性AI与可读科学理论之间的鸿沟。

2026-07-05

大语言模型与模型3 min read

有效上下文、输出上限以及长窗口的隐性代价

你的AI模型说它能读取100万token,它在撒谎。这是真实的数学。

四大前沿大语言模型都宣称拥有100万+ token的上下文,但有效召回、输出限制和实际成本差异显著。DeepSeek V4 Pro 在输出上限和成本上领先,Gemini 在20万token以下表现出色,而 Claude Opus 在交互式代码审查的缓存方面胜出。本文分析了2026年4月的数据。

2026-06-30