SevenTnewS

自动化游戏测试

那张胜过网格的图:为何GAT模型在糖果粉碎游戏测试中胜出

研究人员比较了GAT、BERT和CNN模型在《糖果粉碎传奇》自动化游戏测试中的表现。GAT模型在移动预测和难度估计方面达到或超过了CNN,尤其在困难关卡上表现更佳,同时无需特征工程即可处理新游戏机制。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-31 · 阅读需 4 分钟

那张胜过网格的图:为何GAT模型在糖果粉碎游戏测试中胜出
来源 : Comparative Ana…

多年来,基于网格的益智游戏的自动化游戏测试一直依赖卷积神经网络。它们从棋盘状态中提取空间模式的能力使其成为自然之选。但《糖果粉碎传奇》的开发商King Digital Entertainment研究人员的一项新比较研究表明,最常用的架构可能并非最佳选择。

由Kleio Fragkedaki及其同事领导的论文,将CNN与两种替代方案进行了对比:基于BERT的Transformer模型和图注意力网络(GAT)。目标是在《糖果粉碎传奇》超过18,000个关卡中,看哪种模型能最准确地预测玩家移动并估计关卡难度,其中许多关卡引入了打破网格模型假设的机制。

为何网格模型存在不足

CNN将游戏棋盘视为固定大小的图像,将每个方块的内容编码到单独的通道层中。这对于静态棋盘效果良好,但《糖果粉碎传奇》的设计师不断添加新元素:能在棋盘上传送糖果的传送门、以非局部方式交互的特殊方块,以及因关卡而异的游戏目标。每个新功能都迫使对CNN的输入表示进行重新设计,添加通道、调整卷积核大小,并从头开始重新训练。

GAT模型通过将棋盘表示为图来规避这一问题。方块成为节点,关系, , 如相邻关系和传送门连接, , 成为边。注意力机制随后学习动态加权这些连接,捕捉CNN难以处理的长距离依赖。

数据说话

研究的核心发现:GAT在Top-1移动预测准确率达到54.37%,略高于CNN的53.33%,并在Top-2、Top-3和Top-6指标上均优于CNN。但真正的差距体现在难度估计上:完整GAT模型在所有关卡上的中位数绝对误差为1.61,而CNN为1.98。在困难关卡上,GAT的误差降至10.03,而CNN为14.00。

更具说服力的可能是:当图输入中包含传送门连接时,GAT在带有传送门的关卡上的表现得到提升,在困难传送门关卡上中位数误差为10.69,而CNN为15.24。这是CNN根本无法复制的功能,因为传送门连接了不相邻的方块,打破了卷积滤波器的局部空间假设。

BERT难以适应棋盘结构

基于BERT的模型(将棋盘状态编码为文本序列或矩阵Token)表现不佳。文本变体仅达到22.20%的Top-1准确率,棋盘版本达到35.84%。两者均远落后于CNN和GAT。研究人员指出,Transformer架构缺乏空间先验知识,可能在这种结构化问题上损害性能,尽管其在语言任务上具有优势。

这些结果表明,GAT提供了一条中间路径:它保留了CNN捕捉局部模式的能力,同时获得了建模任意关系的灵活性,而无需为每种新游戏机制进行手动特征工程。

这对自动化游戏测试意味着什么

自动化游戏测试是游戏工作室的关键工具,允许在发布前大规模测试数百个关卡。标准流程包括在历史玩家数据上训练模型,然后使用该模型模拟游戏过程并估计难度指标(如成功所需尝试次数APS)。准确的难度估计使设计师能够在关卡真正让玩家受挫之前进行调整。

研究的关键见解:选择正确的输入表示比选择最新架构更重要。GAT基于图的方法自然映射了游戏棋盘的关系结构,而CNN强加了以网格为中心的观点,随着游戏发展而失效。对于处理超过10,000个关卡并定期更新内容的工作室来说,从CNN转向GAT可能意味着更少的重新训练周期和更一致的测试质量。

未来工作可以探索混合架构,将GAT的关系优势与基于Transformer的序列处理相结合,以实现更精细的玩家建模,但就目前而言,图已经证明了其优势。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。