图基础模型
图上的零样本迁移存在多模态盲点。CHARM提供了一个解决方案
CHARM用结构化的图上下文替换孤立的节点特征,捕获多模态语义和跨模态关系。通过将领域特定模式映射到共享的高级概念,该模型实现了跨文本、图像和其他模态的图的零样本迁移。

零样本迁移是那些听起来简单但尝试起来却不然的机器学习目标之一:在一组图上训练模型,然后将其应用于完全不同领域的图,而不调整权重。当这些图是多模态时,问题变得更加困难:每个节点可能携带文本、图像或两者兼有,而不同模态之间的关系在不同图之间会发生变化。
大多数现有方法要么完全忽略跨模态,要么需要在目标领域进行一轮微调。这耗费时间、标签和计算资源,而对于许多现实世界的图,标签本来就不存在。一篇于2026年7月28日发布在arXiv上的论文采用了不同的路线,提出了CHARM,这是一种围绕作者所称的层次化上下文建模构建的多模态图基础模型。
原始节点的问题
当前在多模态数据上训练的图基础模型往往将领域特定结构与模态特定模式纠缠在一起。社交网络图中的节点可能有头像和个人简介,而产品目录中的节点则有产品照片和描述。这些模态承载不同的语义,模型难以提取出能够跨领域泛化的底层概念。
CHARM通过用包含多模态语义及其跨模态关系的层次化图上下文替换孤立的原始节点特征来解决这个问题。模型不是将每个节点的文本和图像作为独立输入处理,而是围绕每个节点构建一个上下文,该上下文编码了局部图结构以及其多模态属性如何相互关联以及如何与邻居节点关联。
CHARM的工作原理
该架构使用一种模态感知的图上下文编码器,将多模态信息与图结构集成。它将生成的表示转换为图令牌,然后输入到大语言模型中进行下游推理。关键思想是这些层次化上下文将领域特定的节点模式映射到共享的高级概念,从而减少对目标领域适应的依赖。
LLM组件不用于目标领域的微调,它充当解释结构化令牌的推理骨干。由于上下文本身被设计为领域无关,该模型可以跨不同模态、不同结构和不同标签空间的图进行知识迁移。
该论文报告了在零样本多模态图任务上的一致改进,尽管摘要中没有公布具体的分数或基准。作者将CHARM与需要下游适应的基于GNN的基础模型以及通常处理单模态图或单领域任务的基于LLM的图方法进行了对比。
为何重要
多模态图无处不在:电子商务产品图、带有图像和文本的生物医学知识图、具有丰富个人资料的社交网络、带有图表和摘要的科学引文图。构建一个可以在不重新训练的情况下跨这些图进行零样本迁移的模型,可以减少在新领域部署图AI的阻力。
CHARM仍是一篇研究论文,而非已部署的产品,但方向很重要。图基础模型领域一直由那些要么忽略多模态、要么付出适应每个新领域代价的方法主导。在图构建时就融入跨模态关系(而非事后修补)的层次化上下文编码器,可能是一条更具可扩展性的前进路径。
根据arXiv提交信息,代码和数据尚未公开,但该方法足够详细,其他实验室可以复现。如果结果在独立基准测试中得到验证,CHARM可能成为处理多模态图上零样本迁移这一尚未充分探索问题的参考点。
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。