SevenTnewS

生成式 AI

Google 的 CO2Jump 在单次生成中融合文本与图像,并实时自我修正

Google 推出 CO2Jump,一种无需训练的联合文本与图像生成采样器。它利用自我修正的马尔可夫跳跃过程,其中每种模态的置信度分数实时指导另一模态的更新,在单次生成中产生连贯的多模态输出。该方法还附带三个用于评估联合生成的新型基准数据集。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-14 · 最后更新:2026-07-19 · 阅读需 4 分钟

Google 的 CO2Jump 在单次生成中融合文本与图像,并实时自我修正

人类不会在分离的轨道上思考。当老师在白板上画图时,口头讲解与演变的草图会实时相互塑造。当前的多模态 AI 系统大多回避这种耦合。它们先生成文本,然后根据文本生成图像,或者跨不同的去噪步骤交替生成,但每种模态只能访问另一模态的先前输出,而无法访问其进行中的决策。

这种差距很重要,因为跨模态的矛盾只有在最终输出时才被发现。模型可能会生成一个标注“被分成四个象限的正方形”的标题,而它生成的图像却显示一个圆形。在生成过程中,没有任何机制能捕捉到这种不匹配并进行修正。

Google 的一个研究团队(由来自公司研究部门的作者领导)提出了一种旨在闭合这一循环的框架。其成果是 CO2Jump(Self-Correcting Coupled Jump 的缩写),一种无需训练的采样器,它修改了掩码扩散模型(MDM)的标准去噪轨迹,使文本和图像更新在每个步骤内以耦合、自我修正的方式发生。

工作原理:跨模态得分加权

核心思想建立在掩码扩散模型之上,这是一类学习逆转应用于离散 token 的破坏过程的生成模型。CO2Jump 将 MDM 封装在一个“自我修正耦合马尔可夫跳跃过程”(SC-CMJP)中。简而言之,决定 token 是否从掩码状态切换到非掩码状态的转移概率不仅取决于该 token 自身的似然性,还取决于另一个模态中对应区域的置信度得分,并经过跨模态注意力图加权。

示意图:CO2Jump 自我修正耦合生成
CO2Jump 通过跨模态得分加权耦合文本和图像分支,并添加重新掩码跳跃进行自我修正,从而修改了掩码扩散模型的标准去噪轨迹,基于论文。

如果图像生成分支对某个区域不确定,那么文本分支会减慢对关注该区域的 token 的去掩码决策,反之亦然。这就是耦合本身。除此之外,如果在轨迹后期,另一模态对同一语义区域的置信度得分降至阈值以下,重新掩码跳跃允许系统撤回之前的去掩码操作。

研究人员将这种采样器描述为“无需训练”,因为它不需要对底层 MDM 进行微调。它使用相同的预训练模型,仅修改去噪步骤的编排方式。

用于联合生成的三项新基准

为了评估该方法,团队创建了三个大规模联合多模态生成语料库,并计划公开发布所有内容。JEdit-1M 包含 100 万个图像-文本对,专为联合理解和编辑任务设计。JMaze-200K 和 JNono-200K 分别包含 20 万个迷宫和非语谜题,并配有匹配的文本描述,旨在测试结构化、基于规则的视觉推理。所有三个数据集都包含分布内和分布外变体。

根据论文,与现有的交错和并行采样器相比,CO2Jump 在图像理解、图像编辑以及视觉推理任务中均实现了最佳的联合性能。作者报告称,性能随去噪步骤数单调提升,这意味着跨模态耦合的积极作用在更长轨迹中会增强,而非饱和或退化。

为何这对多模态生成重要

更广泛的启示是,联合生成(即文本和图像作为单一连贯产物生成)的质量可能不需要一个全新的架构。它可能只需要一个更智能的采样器,该采样器能够在生成过程中尊重模态间的相互依赖关系。目前大多数流程要么根据固定的文本提示生成图像(无法对图像做出反应),要么跨步骤交替生成,这引入了延迟,且无法回溯性地修复跨模态错误。

CO2Jump 一次性解决了这两个问题。重新掩码跳跃充当一种内部批评者:如果图像分支决定场景的一部分应该与文本分支已承诺的内容不同,文本分支可以撤回其早期决策并尝试不同的 token。

该方法是否能扩展到两种以上模态(例如,添加音频或视频)仍有待探索。论文聚焦于图像-文本对,但 SC-CMJP 框架以模态无关的语言进行描述,为此留下了空间。

包含代码和数据集的项目页面位于 https://coupled-jump.github.io。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。