多模态AI
13 published articles
开放权重 AI
小红书 dots3-note:280B 开源 MoE,仅激活 16B
小红书的 dots studio 发布了其首个开放权重模型 dots3-note preview:一个多模态 MoE,拥有 280B 参数、16B 激活参数和 512K 上下文窗口。这种稀疏设计旨在降低单台 8-GPU 节点上的服务成本,但模型卡尚未公布基准测试数字。
2026-08-20
视频生成
MiniMax 放弃其成熟架构,让 H3 包揽一切
MiniMax 表示,H3 将文本、图像、视频和音频生成统一到一个模型中,2K 输出的定价低于主流模型的三分之一,并计划在数日内开放权重。细则才是真正的故事:该公司为了达到这一目标,放弃了自己曾占据优势的架构。
2026-08-07
Qwen / 阿里云
Qwen2.5-Omni 在 OmniBench 上超越 Gemini-1.5-Pro,可在 12GB 以下显存运行
阿里开源模型 Qwen2.5-Omni 在 OmniBench 上得分超过 Gemini-1.5-Pro,并登顶 MMAU 音频推理排行榜。量化版本将显存占用降至 12GB 以下,MNN 支持将实时语音对话带到手机上。
2026-08-07
模型评测
Qwen2.5-Omni:开源模型终于实现了竞品只承诺的功能
深入解读这个开源模型,它能同时处理文本、图像、音频和视频,并生成流式语音,在多项基准测试中超越GPT-4o-mini和Gemini,且通过量化可适配单张消费级GPU。
2026-08-03
图基础模型
图上的零样本迁移存在多模态盲点。CHARM提供了一个解决方案
CHARM用结构化的图上下文替换孤立的节点特征,捕获多模态语义和跨模态关系。通过将领域特定模式映射到共享的高级概念,该模型实现了跨文本、图像和其他模态的图的零样本迁移。
2026-08-01
视频生成
MiniMax H3 价格低于视频竞争对手,并计划开放权重
MiniMax 将图像、视频和音频生成整合到一个模型中,输出每秒定价低于主流费率的三分之一,并计划数日内开放权重。在其自家演示之外,输出效果究竟如何仍是个悬而未决的问题。
2026-07-30
人工智能
这款7B模型超越更大模型,可在手机上运行,改变AI成本方程
阿里云通义千问Qwen2.5-Omni是一款70亿参数模型,可实时处理文本、图像、音频和视频,同时生成语音和文本。其“思考者-说话者”架构和TMRoPE位置嵌入支持流式交互,30亿参数变体可在骁龙8 Gen 1等移动SoC上以可用速度运行。
2026-07-23
多模态AI
阿里巴巴Qwen2.5-Omni:欲打造集听、看、说于一体的全能模型
阿里云的Qwen2.5-Omni端到端处理文本、图像、音频和视频,实时生成文本和自然语音。基准测试显示,它往往与专业单模态模型持平或更优,暗示向统一架构的转变。
2026-07-20
多模态AI
12B参数模型击败90B:扩展范式遭遇挑战
Pixtral-12B 在多模态基准测试中匹配或超越了比其大七倍的模型,且未牺牲语言性能。Mistral 还发布了一个用于实用视觉语言评估的新开放基准,挑战了“越大越好”的观念。
2026-07-17
具身智能
阿里巴巴通义千问(Qwen)已嵌入15万台机器人、汽车、眼镜和无人机中
阿里巴巴通义千问(Qwen)AI家族现已驱动超过15万台硬件设备,从人形机器人到儿童相机,标志着公司从聊天机器人向具身智能(Physical AI)的战略转型,将多模态模型集成至机器人、汽车、眼镜和无人机中。
2026-07-14
Google DeepMind
Gemma 4 让其他所有开放权重模型看起来都大了10倍
Google DeepMind 的 Gemma 4 原生多模态开放权重系列引入了思考模式、无编码器架构和 MoE 选项。2.3B 模型性能与 Gemma 3 的 27B 模型相当。31B 模型登顶开放权重排行榜。
2026-07-13
阿里云
阿里云EMR Serverless Spark现支持用纯SQL处理图像与视频,无需Python
阿里云EMR Serverless Spark现可直接在SQL中支持图像与视频帧,让数据工程师省去Python开销。一项关于自动驾驶数据预处理的案例显示,基于通义千问视觉模型的自动化ETL流水线已取代人工标注。
2026-07-09