SevenTnewS

多模态AI

9 published articles

实验室与研究3 min read

图基础模型

图上的零样本迁移存在多模态盲点。CHARM提供了一个解决方案

CHARM用结构化的图上下文替换孤立的节点特征,捕获多模态语义和跨模态关系。通过将领域特定模式映射到共享的高级概念,该模型实现了跨文本、图像和其他模态的图的零样本迁移。

2026-08-01

人工智能4 min read

视频生成

MiniMax H3 价格低于视频竞争对手,并计划开放权重

MiniMax 将图像、视频和音频生成整合到一个模型中,输出每秒定价低于主流费率的三分之一,并计划数日内开放权重。在其自家演示之外,输出效果究竟如何仍是个悬而未决的问题。

2026-07-30

Qwen / 阿里巴巴2 min read

人工智能

这款7B模型超越更大模型,可在手机上运行,改变AI成本方程

阿里云通义千问Qwen2.5-Omni是一款70亿参数模型,可实时处理文本、图像、音频和视频,同时生成语音和文本。其“思考者-说话者”架构和TMRoPE位置嵌入支持流式交互,30亿参数变体可在骁龙8 Gen 1等移动SoC上以可用速度运行。

2026-07-23

人工智能5 min read

多模态AI

阿里巴巴Qwen2.5-Omni:欲打造集听、看、说于一体的全能模型

阿里云的Qwen2.5-Omni端到端处理文本、图像、音频和视频,实时生成文本和自然语音。基准测试显示,它往往与专业单模态模型持平或更优,暗示向统一架构的转变。

2026-07-20

大语言模型与模型2 min read

多模态AI

12B参数模型击败90B:扩展范式遭遇挑战

Pixtral-12B 在多模态基准测试中匹配或超越了比其大七倍的模型,且未牺牲语言性能。Mistral 还发布了一个用于实用视觉语言评估的新开放基准,挑战了“越大越好”的观念。

2026-07-17

NLP与机器学习Featured4 min read

具身智能

阿里巴巴通义千问(Qwen)已嵌入15万台机器人、汽车、眼镜和无人机中

阿里巴巴通义千问(Qwen)AI家族现已驱动超过15万台硬件设备,从人形机器人到儿童相机,标志着公司从聊天机器人向具身智能(Physical AI)的战略转型,将多模态模型集成至机器人、汽车、眼镜和无人机中。

2026-07-14

大语言模型与模型Featured4 min read

Google DeepMind

Gemma 4 让其他所有开放权重模型看起来都大了10倍

Google DeepMind 的 Gemma 4 原生多模态开放权重系列引入了思考模式、无编码器架构和 MoE 选项。2.3B 模型性能与 Gemma 3 的 27B 模型相当。31B 模型登顶开放权重排行榜。

2026-07-13

大语言模型与模型2 min read

阿里云

阿里云EMR Serverless Spark现支持用纯SQL处理图像与视频,无需Python

阿里云EMR Serverless Spark现可直接在SQL中支持图像与视频帧,让数据工程师省去Python开销。一项关于自动驾驶数据预处理的案例显示,基于通义千问视觉模型的自动化ETL流水线已取代人工标注。

2026-07-09

开源2 min read

开源

首个无需HTML的开源网络智能体击败GPT-4o

MolmoWeb智能体提供4B和8B两种规模,基于新数据集MolmoWebMix训练,该数据集结合了超过13万个合成和人工演示。它们超越了封闭模型,为开源网络智能体研究设定了新标准。

2026-04-10