SevenTnewS

人工智能

为什么在三个基准测试上最好的图欺诈检测器不使用自己的标签

PREF-Gate将欺诈检测分解为一个无标签上下文专家和一个标签派生证据专家,然后通过一个验证门来决定使用哪一个。在Amazon和YelpChi上,它完全放弃了证据;只有在TFinance上,它才接受少量混合。该论文迫使领域正视:许多已发表的GNN增益背后,驱动因素可能是标签泄露,而非模型架构。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-29 · 阅读需 6 分钟

为什么在三个基准测试上最好的图欺诈检测器不使用自己的标签
来源 : PREF-Gate: Prov…

用于欺诈检测的图神经网络共享一个不言自明的假设:信息越多越好。推理认为,如果一个节点的邻居带有标签,那么将这些标签输入模型应该会改善其预测。来自中南大学和悉尼科技大学的一个团队构建了一个系统来检验这一假设,并且在三个标准基准中的两个上,拒绝了它。

他们的框架名为PREF-Gate(带有验证门选择来源约束关系证据融合),在严格的相同协议评估下,在Amazon上实现了0.9085的平均AUPRC,在YelpChi上为0.8104,在TFinance上为0.8913。这些数字超越了所有完成的外部基线,包括两种ICLR 2024方法(PMP和ConsisGAD),优势从0.0245到0.4291不等。令人惊讶的不是PREF-Gate获胜,而是它在Amazon和YelpChi上的获胜配置与一个更简单的、无标签专家完全相同。

两位专家,一道门

PREF-Gate将欺诈检测分解为两个固定的专家。无标签上下文专家仅依赖原始节点属性、一跳邻居均值、绝对特征残差、对数度和隔离指标。它在此表示上训练一个直方图梯度提升分类器,并生成欺诈概率p(C)

证据上下文专家增加了七列训练标签派生的证据:原始邻居风险、经验贝叶斯后验均值和方差、支持计数、可用性标志、收缩位移和训练流行度。关键是,该证据向量中的每个标签都仅来自训练集,并带有自排除和留一先验,以防止任何节点泄露自己的目标。一个极端随机树分类器在连接后的表示上进行训练,并生成p(E)

有限的验证自适应门随后在五个候选者中选择:两位专家和三种凸混合(75/25、50/50、25/75)。选择基于Macro-F1和AUPRC的综合验证分数,并且在测试推理之前冻结所选候选者的决策阈值。整个流程在见到任何测试标签之前就已指定并记录。

当证据有害时

关键结果是,自适应门在Amazon的所有五个分区和YelpChi的所有五个分区中选择了无标签上下文专家。添加训练标签证据产生的验证分数比不加更差。仅证据上下文专家在Amazon上得分为0.7715 AUPRC,在YelpChi上为0.5932,远低于无标签专家的0.9085和0.8104。

"在Amazon和YelpChi上,门拒绝了不受支持的标签派生证据,"作者写道。该框架的稳健性来自于它愿意说"不"。

只有在TFinance上,门接受了证据,在四个分区中选择了75/25上下文/证据混合,在一个分区中选择了25/75混合。由此产生的0.8913 AUPRC超过了无标签专家的0.8860,优势虽小但在统计上一致(配对t检验p = 0.0030)。

为什么证据在两个数据集上失败,在一个数据集上成功?论文提供了三种解释。首先,可用的训练标签支持可能稀疏,使得局部风险变得嘈杂而无法反映全局先验。其次,欺诈可能表现出异质性连接,其中邻居的标签具有误导性。第三,无标签表示可能已经编码了判别性信号,而七个证据列增加了方差却没有信号。TFinance的低欺诈流行率(4.58%)和密集归一化图使得支持感知的邻居风险真正具有互补性。

对比名单揭示了什么

评估使用了五个相同的分层40/20/40分区,适用于每种方法,并公布了精确的分区索引和SHA256哈希。14种方法名单包括特征级和图级基线、消融组件、已建立的GNN基线(CARE-GNN、PC-GNN、BWGNN)以及两种ICLR 2024方法(PMP、ConsisGAD)。

结果明确无误:在所有完成的比较中,PREF-Gate具有正的平均AUPRC优势,并在五个配对分区中获胜。最大的优势出现在YelpChi上,仅无标签专家就比CARE-GNN高出0.4291 AUPRC,比PC-GNN高出0.3180。即使是最接近的已完成基线(Amazon上的ConsisGAD),也落后了0.0389 AUPRC。

论文在失败方面也很透明。PC-GNN因方法不兼容无法完成TFinance,而PMP因基础设施限制(14 GiB主机内存上限)无法完成TFinance。没有数字被插补。

校准:隐藏的权衡

尽管PREF-Gate在排名和审核预算指标上领先,但其校准结果参差不齐。在Amazon(0.0165)和TFinance(0.0182)上Brier分数较低,但在YelpChi上预期校准误差达到0.1077,比ConsisGAD的0.0515更差。该门优化了区分能力,而非校准能力;没有拟合事后校准器。

"这些结果促使需要单独进行部署校准,"作者指出。一个平台可以在排名模型固定后,仅使用验证数据拟合一个校准器,但这构成一个额外的、未在此基准中评估的方法组件。

可审计性作为设计原则

PREF-Gate的设计优先考虑可审计性,而非端到端优化。证据向量不仅记录邻居风险率,还记录其支持计数、后验方差和收缩位移, , 这些都是可靠性的显式描述符。候选集是有限的且预先指定。回退到无标签专家不是紧急例外,而是一个定义好的结果。

"审稿人可能会合理地问,一种回退到内部专家的方法是否仍然是一种单一方法,"作者承认。他们的回答是肯定的:路由规则是在测试评估之前指定的,就像验证选择的检查点或正则化值是学习协议的输出一样。

对于操作工作流程,该框架要求训练分区哈希、图快照、证据浓度、候选得分轨迹、阈值和审核预算政策都与所选模型一起提供。这些工件允许在标签延迟或图漂移的情况下进行后续审计。

对图欺诈研究的影响

论文最强的贡献可能在方法论上。通过将无标签上下文与标签派生证据分离并暴露门的决策,PREF-Gate迫使领域面对一个许多论文回避的问题:图神经网络的性能提升究竟来自架构,还是来自更严谨的基线才能揭示的标签泄露?

事实证明,一跳均值和绝对残差变换是一个非常强大的比较对象。"这个结果并不意味着学习型GNN普遍不必要,"作者写道。"它表明,在这三个基准和监督比例下,一个透明的图上下文表示是一个强大的比较对象。一个公正的图欺诈研究应该包含这样的基线,而不是将所有图增益归功于神经架构。"

随着完整框架、分区文件和执行记录公开,PREF-Gate既提供了一个有竞争力的方法,也为可审计证据的决策流程提供了一个模板。社区是会采纳这一模板,还是继续将标签派生的邻居风险视为未经审视的免费午餐,仍然是一个开放问题。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。