SevenTnewS

混合专家模型

13 published articles

大语言模型与模型5 min read

开放权重 AI

小红书 dots3-note:280B 开源 MoE,仅激活 16B

小红书的 dots studio 发布了其首个开放权重模型 dots3-note preview:一个多模态 MoE,拥有 280B 参数、16B 激活参数和 512K 上下文窗口。这种稀疏设计旨在降低单台 8-GPU 节点上的服务成本,但模型卡尚未公布基准测试数字。

2026-08-20

Qwen / 阿里巴巴5 min read

开源AI:阿里巴巴开放Max层级

Qwen 3.8-Max:阿里巴巴最强大模型现已开放免费下载

阿里巴巴正在开源其有史以来最强大的模型Qwen 3.8-Max:一款2.4T参数的MoE模型,在SWE-bench Pro、PaperBench和IFBench上超越GPT-5.6 Sol。我们解析了基准测试的注意事项,以及95B活跃参数的开源旗舰对开发者意味着什么。

2026-08-16

NVIDIA Research4 min read

AI 模型 | NVIDIA Nemotron 3.5 Lightning

为什么 Nemotron 3.5 Lightning 认为大多数智能体步骤不需要大模型

Nvidia 的新开源模型在本地运行,具有 3B 激活参数和 100 万 token 上下文,专为持续运行的智能体打造。Nvidia 声称吞吐量最高可达同类开源模型的 4 倍,任务完成速度快 30%。

2026-08-14

Qwen / 阿里巴巴4 min read

开源AI

阿里巴巴最大模型独自编码16天,下周权重将公开发布

Qwen3.8-Max在2.4万亿参数中仅激活950亿,在Vision Arena中排名第二,并在16天的自主运行中构建了一个智能体框架。阿里巴巴将于下周首次开源发布旗舰模型的权重。

2026-08-10

开源6 min read

开源

一场租用 GPU 的接力赛以 200 美元训练出 NanoColibri 的 2.7B MoE

NanoColibri-Instruct 以大约 200 美元从空白权重变成了一个可用的 2.7B MoE。志愿者在 Hugging Face Hub 上传递训练接力棒,一次一台租用 GPU,通过比较并交换租约确保永远不会有两个人在同一段上训练。

2026-08-04

xAI / GrokFeatured3 min read

Grok 4.5

Cursor的Grok 4.5由AI智能体而非人类构建, , 这才是真正的新闻。

Cursor的Grok 4.5是一个混合专家模型,使用由早期AI智能体(而非人类)创造的环境中的强化学习进行训练。它能处理软件工程、数据科学、金融和法律等领域复杂且耗时长久的任务,现已可用。

2026-07-10

Qwen / 阿里巴巴Featured5 min read

产品组合策略

阿里Qwen正在为每一项AI任务构建专属模型,而非一统天下

阿里云Qwen团队悄然发布了一个35B MoE智能体世界模型、三个新的ASR模型以及一份图像生成强化学习报告,显示出在AI模型竞赛中以广度而非奇观为核心的战略押注。

2026-07-09

Google DeepMindFeatured4 min read

谷歌DeepMind

谷歌DeepMind的Gemma 4:260亿参数推理引擎,单GPU即可运行

谷歌DeepMind的Gemma 4技术报告详细介绍了一系列开权重模型,采用混合专家架构、100万token上下文窗口和多模态视觉能力。此次发布标志着谷歌DeepMind的一项战略举措:让开发者无需依赖专有API成本即可获得前沿推理能力。

2026-07-09

人工智能3 min read

人工智能

Aleph Alpha新发布的超级内核库将MoE推理延迟降低200%

Alpha-MoE将多个操作融合到单个持久内核中,在vLLM和SGLang中相比基于Triton的内核实现了高达200%的推理速度提升,目标为FP8精度的MoE模型。

2026-07-09

实验室与研究6 min read

人工智能

Ai2推出EMO:模块化AI从数据中自然涌现,无需人为规则

Ai2的新型MoE模型EMO采用新颖的训练方法,让专家模块从数据中自然涌现,实现选择性使用专家且性能损失极小。该模型在基准测试中与标准MoE性能相当,同时提供了显著改善的模块化能力。

2026-07-07

人工智能2 min read

深度解析

Aleph Alpha 为 DeepSeek 构建理论推理模型:从硬件原语推导性能

Aleph Alpha 为 DeepSeek v3 创建了一个理论推理模型,用于从硬件参数估算吞吐量,分析不同 GPU 配置下的权衡,帮助实践者优化大型 MoE 模型的性能与成本。

2026-07-05

DeepSeek2 min read

大语言模型推理优化

Aleph Alpha 构建理论推理模型,从硬件原语解码 DeepSeek V3 性能

Aleph Alpha 的理论模型仅凭硬件参数即可预测 DeepSeek V3 的推理性能,揭示 GPU 数量和互连带宽如何改变计算、内存和通信之间的瓶颈。

2026-07-04

← PreviousPage 1 / 2 · 13 articlesNext →