SevenTnewS

游戏AI

至今没有AI游戏引擎解决的三个问题:一致性、可导航性、评估

MAGIC是一个四阶段流水线,可将单个提示转换为包含多个连接场景的可玩Unity项目。它通过洪水填充验证器强制实现传送门可达性,并引入一个评估代理,该代理实际上会穿越每个过渡,补充了数十年来仅关注单个室内环境的指标。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-30 · 阅读需 5 分钟

至今没有AI游戏引擎解决的三个问题:一致性、可导航性、评估
来源 : MAGIC: Transiti…

多场景导航, , 在一个房间内完成目标、穿越传送门进入下一个房间, , 是地牢爬行游戏、密室逃脱和角色扮演游戏的基石。但手动构建这些连接空间是3D游戏制作中最劳动密集的部分之一。传送门端点必须在两侧匹配,家具不得堵塞门口,每个过渡脚本必须在数十个文件中引用正确的目标场景。

三个缺失的部分

最近由LLM驱动的系统(如Holodeck和Scenethesis)使单个室内生成的成本大幅降低,但它们一次只生成一个场景。对多个场景简单地重复这些方法会暴露出之前没有方法解决的三个障碍。

一致性。 过渡是一个联合对象:传送门只有在两侧都存在且类型和效果匹配时才有效。在无状态的单场景提示下,LLM随着上下文增长往往会丢失或幻觉化跨场景引用。

可导航性。 即使传送门在两侧命名正确,一旦放置家具,沙发或桌子可能会堵塞门口。没有单场景指标曾检查过这一点。

评估。 现有的文本转3D指标衡量一个室内环境的视觉保真度或提示对齐度。它们从不执行过渡,因此错误链接的传送门或有问题的脚本对它们来说是不可见的。

MAGIC的工作原理

该系统名称代表“多场景自动化游戏世界生成器与智能连接”,是一个四阶段流水线。规划阶段使用LLM将单个提示解析为每个场景的描述和一个共享的、具有过渡感知的中间表示, , 一个以场景为节点、传送门为边的图,边上标有FadeInOut或IrisWipe等效果。一个验证循环确保每个所需的传送门都出现在描述中。

场景规范阶段为每个场景扩展物体放置,然后在二维占用网格上运行洪水填充算法,拒绝任何传送门被物理堵塞的布局。如果家具堵塞了门口,放置模块会重新生成,直到连通性分数达到1.0或达到最大重试限制。

在场景生成阶段,网格被组装起来,LevelLoader过渡脚本被绑定到传送门碰撞器上。组合阶段将每个场景的Unity项目拼接成一个可执行文件,场景之间通过生成的脚本相互引用。

超越视觉的基准测试

由于现有指标无法验证多场景过渡,团队构建了一个包含100个测试用例的基准测试,这些用例来自MIT Indoor 67和MMIS数据集,涵盖了1到5个场景的场景图、循环和分支模式,以及包括门、窗户和目录板在内的混合传送门类型。每个案例都提供了真实传送门、可达性状态和目标过渡效果。

他们还构建了一个专注于过渡的评估代理,直接对打包好的Unity项目进行操作。该代理提取传送门候选对象,在播放中执行每个过渡,从起点导航到每个传送门,并使用MLLM判断器评估传送门外观与真实情况的匹配程度。在与人类判断的测试中,该代理的平均绝对差异仅为0.03,这意味着其准确率、召回率、F1分数、接近率和传送门匹配率等得分与人类评估员的报告结果相差在3%以内。

数据一览

逐阶段来看,MAGIC恢复了96.72%的真实场景需求(相比之下,普通LLM基线的恢复率为92.39%),以及97.11%的过渡图边(相比之下,基线的恢复率为90.89%)。在场景规范中,其召回率, , 实际生成的所需传送门比例, , 达到94.87%,远高于Holodeck的60.26%。连通性(衡量每个可步行单元格是否能到达每个传送门)为0.9952,而Holodeck为0.8545;占用率(场景密度的一个代理指标)为平衡的28%,既不太稀疏也不太拥挤。

端到端来看,该流水线为所有100个测试用例生成了可执行的Unity项目。LLM基线生成的所有项目都未能运行。MAGIC在过渡识别上的精确率为0.987,召回率为0.948,F1分数为0.964。接近率, , 从玩家起始位置实际可达的传送门比例, , 为94.86%。较低的传送门匹配率(78.85%)反映了MLLM判断器的严格性:一个普通板被生成为“目录板”最接近的网格,但判断器要求有目录功能的视觉证据。

这对游戏开发意味着什么

结果表明,结构化的中间表示结合物理感知验证可以弥补LLM固有的空间盲点。抽象推理和数学规划, , 洪水填充算法、占用网格、验证循环, , 是将语言模型的模糊理解转化为可工作游戏项目的工程层。

MAGIC目前针对室内场景和Unity引擎,仅支持两种过渡效果,且仅接受英文文本提示。网格数据集限制了传送门外观:当最接近的可用网格缺乏传送门名称所暗示的语义线索时,即使过渡功能正常,视觉匹配也会失败。研究人员指出,性能在测试的1到5个场景范围内没有下降,但未声称在此范围之外具有可扩展性。

完整代码已在GitHub上发布。对于游戏设计师来说,其启示是明确的:能够根据一句话输出多房间可玩世界的AI流水线已经从学术好奇跨越到了可用工具。剩下的差距, , 更丰富的网格库、更多的过渡类型、对室外空间的支持, , 是工程时间问题,而非研究突破。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。