图像生成
阿里通义千问Qwen-Image-3.0:将文本渲染转化为生产力论据
阿里巴巴通义千问团队发布了第三代图像生成模型Qwen-Image-3.0,该模型优先考虑密集内容和实用可用性,而非审美上的精雕细琢。该模型可处理4500个token的提示词,清晰渲染10像素大小的文本,并能一次性生成完整的报纸版面或多格信息图。

大多数图像生成模型都想成为艺术家。阿里巴巴的通义千问团队希望其最新模型能成为一条生产线。
于7月21日宣布的Qwen-Image-3.0是通义千问图像系列的第三代产品,其定位与该领域的发展方向悄然不同。在DALL-E和Midjourney追求视觉精美和风格多样性的地方,Qwen-Image-3.0追求的是密度、精确性和实用性。该模型可接受长达4500个token的提示词,渲染小至10像素的文本,并能在单次生成中输出复杂的布局,如报纸、试卷和多面板信息图,而非通过拼接不同输出得到。

由通义千问团队撰写的演示博客文章提供了大量示例。最引人注目的之一是一个3x3的信息图网格,内容涵盖隧道安全、群论、医学图表等,所有内容均通过一个3700个token的提示词一次性生成。每个单元格都是一幅独立的信息图,拥有自己的文本、公式和布局。该模型还展示了团队所称的“画中画”深度:一个提示词即可生成一个包含通义千问聊天界面的VSCode窗口,该界面中又包含一个展示手冲咖啡海报的微信屏幕,每个图层都保留了自己的风格和文本。
对文本渲染的强调是经过深思熟虑的。该模型宣称能清晰渲染小至10像素的文本,提供的示例包括一份代数几何学论文的完整页面,其中包含密集的LaTeX公式、上下标和定理编号。另一个示例展示了一份包含多栏和标题的报纸版面。在一个编辑前后对比演示中,该模型为教科书页面添加了逼真的手写注释,包括下划线、箭头和以自然笔迹书写的旁注。
编辑流程本身也得到了扩展。Qwen-Image-3.0可以修复受损的传统绘画,替换现有构图中的元素,并通过在真实照片上叠加图层来生成复杂的信息图。团队展示了一幅受损的鹰搏斗水墨画被修复至其原始形态,霉斑被去除,笔触与原作者风格相匹配。
语言支持是另一个声称的差异化优势。该模型原生支持12种语言的文本渲染,演示示例包括日语、韩语和西班牙语。它还能模拟主流用户界面,包括网页、直播间和游戏画面。博文中包含一张从网络获取的杭州天气预报生成图、一个齐白石和梵高介绍产品的直播间,以及一张叠加在真实股票行情图上的金融信息图。
Qwen-Image-3.0可通过通义千问工作室(该公司的统一平台,用于聊天、图像、视频和文档处理)及其API使用。博文将此次发布定位为从第一代的“精准”、第二代的“精准、多样、完整、美观、真实”到第三代单一关键词“实”(意为实用、实在、扎实)的自然演进。
该模型并未将自己定位为Midjourney艺术指导或DALL-E风格多样性的竞争对手。它瞄准的是那些文本准确性、布局复杂性和信息密度比视觉效果更重要的生产工作流程。这包括报纸排版、试卷创建、学术图表、电商海报和用户界面原型设计。该模型能否大规模兑现这些承诺,以及以文本为主的图像生成市场是否足够大以证明其投资的合理性,仍有待观察。但这一选择是经过深思熟虑的,正因其不试图在美学上取胜,使得Qwen-Image-3.0成为今年更有趣的图像生成版本之一。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。