AI 研究
理解必须先于生成:MiniMax 的新分词器如何打破缩放瓶颈
MiniMax 的 VTP 框架重新思考了视觉分词器的预训练方式,用混合了语义理解的损失替代了纯粹的重建目标。结果是一个随计算量、数据和参数规模扩展的分词器,以及在下游生成任务中 65.8% 的 FID 改进。

多年来,视觉分词器的标准故事很简单:让像素尽可能接近原始图像,生成器下游会处理好其余部分。但事实证明,这个故事是错的。
来自 MiniMax 与华中科技大学 Vision Lab 合作的一篇新论文记录了所谓的“预训练缩放问题”:向仅重建训练的视觉自编码器中投入更多计算资源,实际上可能使下游生成效果更差。他们提出的框架 VTP(视觉分词器预训练)完全颠覆了这一逻辑,将分词器重新定位为首先是语义学习者,然后才是像素重建者。虽然结果仍处于研究阶段,但这表明这可能是可扩展生成视觉的正确方向。
基于 VAE 生成的核心悖论
变分自编码器(VAE)已成为现代生成模型(如 Stable Diffusion 和 DiT)的默认视觉分词器。它们将图像压缩到一个潜空间,然后由扩散或自回归模型学习解码生成新输出。衡量这些分词器质量的传统指标是重建保真度,即压缩再解压缩后的图像与源图的匹配程度。
VTP 的核心发现是,这一指标具有误导性。当缩放标准自编码器时,重建 rFID 改善了,但生成 gFID 实际上却上升了。在论文的一项实验中,将计算量从最早的检查点增加到后期,rFID 提升至 0.5,但生成 gFID 却从 55.04 恶化到 58.56。潜空间越来越擅长保留低层细节,却越来越不擅长提供生成器可使用的语义骨架。

这与语言模型的类比不容忽视。在自然语言处理中,该领域从 n-gram 统计过渡到捕捉含义的预训练嵌入,生成质量随之提升。视觉领域似乎也正在得出相同的结论,尽管时间较晚:一个理解所见内容的分词器比一个仅仅忠实压缩的分词器更有用。
论文中最引人注目的图表之一展示了分词器在 ImageNet 分类上的零样本准确率(作为语义理解的代理)与其下游生成 FID 之间的相关性。这种关系近乎线性:理解越好,生成越好。这是仅重建范式所忽视的相关性。
三个损失,一个分词器
VTP 并未完全抛弃重建。它将训练重构为三个并行目标:标准的图像-文本对比损失(类似 CLIP),用于将视觉特征与语言语义对齐;自监督损失(类似 DINO),用于捕捉图像内部的空间和结构关系;以及重建损失,用于维持低层保真度。最终损失是一个简单的加权和,但创新在于框架:表示学习是主要驱动因素,重建是正则化项。
这种架构产生了正确的缩放行为。当仅重建的分词器在约十分之一计算预算后就饱和时,VTP 持续改进,且速率更快。完整的 VTP 框架(CLIP + SSL + AE)在固定计算预算下实现了 27.8 的 gFID 和 74.9% 的线性探测准确率,优于任何单目标变体。更具说服力的是,将分词器的经验跨数据量和模型参数进行缩放会产生一致的收益,这在旧范式下是不可能的。
定量基准测试结果
| 场景 | 指标 | 标准 AE | VTP | 改进 |
|---|---|---|---|---|
| 数据缩放(10万 → 1亿样本) | gFID | 58.37 → 56.71 | 47.59 → 27.45 | 下降约30点 |
| 收敛速度(对比 VA-VAE) | 训练步数 | 基线 | 快 4.1 倍 | 减少 75% 步数 |
| 零样本分类 | ImageNet 准确率 | 约 60%(估计) | 78.2% | 提升约18点 |
| 计算缩放(10× FLOPs) | gFID | 恶化 | 改善 65.8% | 质的飞跃 |
在大型预训练后,VTP 在 ImageNet 上达到了 78.2% 的零样本准确率和 0.36 的重建 rFID。在生成方面,它的收敛速度比 VA-VAE 快 4.1 倍,VA-VAE 是一种基于蒸馏的方法,此前被认为是分词器到生成器迁移的最先进技术。
这对生成式 AI 管线意味着什么
最实用的结果也是最简单的:你可以扩展下游的 DiT 生成器而无需调整其训练配置,收益几乎完全来自分词器的预训练预算。这正是该领域所缺乏的。生成式管线中的每个组件(编码器、解码器和去噪器)之前都必须一起调优。VTP 将分词器缩放问题与生成器缩放问题解耦,这简化了研究,并最终简化了生产部署。
论文的代码已在 GitHub 上开源,权重上传至 Hugging Face,这意味着这些经验教训可以被复现并直接应用。对于构建图像或视频生成模型的实验室和初创公司来说,结论很明确:停止为像素精度优化分词器,开始训练它们理解所看到的内容。
这里的更广泛脉络是 AI 社区不断重新发现的一个道理:表示质量比模型规模或训练数据本身是更强的杠杆。VTP 本身不是生成模型,它是一个分词器。但如果其发现在大规模下成立,它可能最终为下一代生成视觉模型提供运行的基石。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。