混合专家模型
13 published articles
开放权重 AI
小红书 dots3-note:280B 开源 MoE,仅激活 16B
小红书的 dots studio 发布了其首个开放权重模型 dots3-note preview:一个多模态 MoE,拥有 280B 参数、16B 激活参数和 512K 上下文窗口。这种稀疏设计旨在降低单台 8-GPU 节点上的服务成本,但模型卡尚未公布基准测试数字。
2026-08-20
开源AI:阿里巴巴开放Max层级
Qwen 3.8-Max:阿里巴巴最强大模型现已开放免费下载
阿里巴巴正在开源其有史以来最强大的模型Qwen 3.8-Max:一款2.4T参数的MoE模型,在SWE-bench Pro、PaperBench和IFBench上超越GPT-5.6 Sol。我们解析了基准测试的注意事项,以及95B活跃参数的开源旗舰对开发者意味着什么。
2026-08-16
AI 模型 | NVIDIA Nemotron 3.5 Lightning
为什么 Nemotron 3.5 Lightning 认为大多数智能体步骤不需要大模型
Nvidia 的新开源模型在本地运行,具有 3B 激活参数和 100 万 token 上下文,专为持续运行的智能体打造。Nvidia 声称吞吐量最高可达同类开源模型的 4 倍,任务完成速度快 30%。
2026-08-14
开源AI
阿里巴巴最大模型独自编码16天,下周权重将公开发布
Qwen3.8-Max在2.4万亿参数中仅激活950亿,在Vision Arena中排名第二,并在16天的自主运行中构建了一个智能体框架。阿里巴巴将于下周首次开源发布旗舰模型的权重。
2026-08-10
开源
一场租用 GPU 的接力赛以 200 美元训练出 NanoColibri 的 2.7B MoE
NanoColibri-Instruct 以大约 200 美元从空白权重变成了一个可用的 2.7B MoE。志愿者在 Hugging Face Hub 上传递训练接力棒,一次一台租用 GPU,通过比较并交换租约确保永远不会有两个人在同一段上训练。
2026-08-04
Grok 4.5
Cursor的Grok 4.5由AI智能体而非人类构建, , 这才是真正的新闻。
Cursor的Grok 4.5是一个混合专家模型,使用由早期AI智能体(而非人类)创造的环境中的强化学习进行训练。它能处理软件工程、数据科学、金融和法律等领域复杂且耗时长久的任务,现已可用。
2026-07-10
产品组合策略
阿里Qwen正在为每一项AI任务构建专属模型,而非一统天下
阿里云Qwen团队悄然发布了一个35B MoE智能体世界模型、三个新的ASR模型以及一份图像生成强化学习报告,显示出在AI模型竞赛中以广度而非奇观为核心的战略押注。
2026-07-09
谷歌DeepMind
谷歌DeepMind的Gemma 4:260亿参数推理引擎,单GPU即可运行
谷歌DeepMind的Gemma 4技术报告详细介绍了一系列开权重模型,采用混合专家架构、100万token上下文窗口和多模态视觉能力。此次发布标志着谷歌DeepMind的一项战略举措:让开发者无需依赖专有API成本即可获得前沿推理能力。
2026-07-09
人工智能
Aleph Alpha新发布的超级内核库将MoE推理延迟降低200%
Alpha-MoE将多个操作融合到单个持久内核中,在vLLM和SGLang中相比基于Triton的内核实现了高达200%的推理速度提升,目标为FP8精度的MoE模型。
2026-07-09
人工智能
Ai2推出EMO:模块化AI从数据中自然涌现,无需人为规则
Ai2的新型MoE模型EMO采用新颖的训练方法,让专家模块从数据中自然涌现,实现选择性使用专家且性能损失极小。该模型在基准测试中与标准MoE性能相当,同时提供了显著改善的模块化能力。
2026-07-07
深度解析
Aleph Alpha 为 DeepSeek 构建理论推理模型:从硬件原语推导性能
Aleph Alpha 为 DeepSeek v3 创建了一个理论推理模型,用于从硬件参数估算吞吐量,分析不同 GPU 配置下的权衡,帮助实践者优化大型 MoE 模型的性能与成本。
2026-07-05
大语言模型推理优化
Aleph Alpha 构建理论推理模型,从硬件原语解码 DeepSeek V3 性能
Aleph Alpha 的理论模型仅凭硬件参数即可预测 DeepSeek V3 的推理性能,揭示 GPU 数量和互连带宽如何改变计算、内存和通信之间的瓶颈。
2026-07-04