SevenTnewS

AI 供应链

新研究警告:通过公开评论投毒大语言模型是可行的

华盛顿大学研究人员证明,通过自动化评论垃圾邮件投毒预训练数据是一个现实威胁。他们的 HalfLife 分析显示,0.13% 的投毒注入能够完整通过整个数据流水线,足以超过已知的攻击阈值,并影响基于 Common Crawl 训练的模型。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-26 · 阅读需 7 分钟

新研究警告:通过公开评论投毒大语言模型是可行的
来源 : Pretraining Dat…

语言模型会消化从开放网络抓取的海量 token。这些数据集的规模使得人工审核员几乎不可能审查每一份文档。先前的研究主要针对维基百科等知名且经过精心策划的来源进行投毒攻击,这部分内容在现代语料库(如 Dolma 3)中约占文档的 0.067%。华盛顿大学的一项新研究认为,真正的威胁存在于别处:在普通网站的匿名评论区。

在假期期间悄然发布、如今在机器学习安全研究人员中广泛流传的一篇论文中,Victoria Graf 及其同事介绍了 HalfLife,这是一个概率框架,用于评估注入到网页中的恶意内容是否能在整个流水线中存活:从网络抓取,到文本提取,再到启发式和质量过滤,最终进入最终训练语料库。他们的结论是:在现实假设下,基于评论的投毒是一种可行且可扩展的攻击向量,而当前的数据处理流水线并非设计用来捕捉这种攻击。

从维基百科到开放网络

大多数投毒研究都集中在攻击者可以直接访问训练数据集来源的场景。Carlini 等人(2024 年)表明,购买已发布数据集引用的过期域名,或编辑维基百科,可以将投毒内容注入下游训练集。但这些方法针对的是网络上一个狭小且受到良好管理的部分。华盛顿大学团队提出了一个更广泛的问题:占预训练数据绝大部分、来自 Common Crawl、在 Dolma 3 中占 97% 的非维基百科文档又当如何?

他们的答案是提出一种他们称为第三方内容注入的新攻击面:攻击者利用自动化评论基础设施,即使用 Selenium 或 Playwright 提交表单的脚本,在那些接受公众参与评论的网站上分发恶意文本。攻击者无需拥有该网站、控制抓取过程或访问训练流水线。他们只需大规模发布内容。

HalfLife:一个估算投毒内容被纳入的框架

HalfLife 将内容从注入到被纳入的过程分解为三个阶段:

图表:数据流水线中的存活率:从网页到训练语料库
基于华盛顿大学研究对 Common Crawl 数据的 HalfLife 框架分析,展示了从最初带有评论基础设施的网页到最终被纳入训练语料库的每个阶段的存活率。
  • S1,可注入页面:该页面必须接受第三方内容。团队分析了从 Common Crawl 分片 CC-MAIN-2025-51 中抽取的 181,857 个页面,发现 3.4% 的页面带有评论基础设施。其中,WordPress 占主导地位(85.2%),其次是通用表单(27.5%)和 Facebook 评论(19.0%)。在带有评论的页面中,有 84,429 个页面(大约 22.6%)暴露了接受未认证用户发布的开放表单。
  • S2,被爬虫捕获:即使评论出现在实时网络上,爬虫也必须在其提取的输出中保留它。团队通过用对抗性问答对(平均长度:37.5 个单词)替换真实评论文本,模拟了注入过程,然后应用 Dolma 3 和 DCLM 使用的工具 Resiliparse 从 HTML 中提取纯文本。他们发现 71.9% 的注入评论在文本提取后存活下来。
  • S3,在数据管理中存活:团队将提取的文档送入 Dolma 3 中完整的 AllDressed 流水线,其中包括启发式过滤器(URL 黑名单、长度和重复检查)、英语语言识别(fasttext,阈值 0.65)和质量分类器。在到达此阶段的页面中,5.5% 通过了所有过滤器。天然评论的通过率略高,为 7.2%。

将这些概率相乘,得出端到端的纳入率为 0.13%。这个数字听起来很小,但研究人员指出,基于 Common Crawl 的语料库中 0.13% 的文档,其数量超过了整个维基百科部分(0.067%)的页面数量。

实施攻击需要什么条件?

该论文将这种纳入概率与实际的攻击者预算联系起来。Souly 等人(2025 年)的早期工作发现,只需 250 份投毒文档 就足以将后门注入预训练模型,无论模型或数据集的大小如何。按 0.13% 的纳入率计算,针对 250 个最终投毒页面的攻击者,需要尝试在大约 192,000 个网页上进行注入。考虑到团队在单个 Common Crawl 分片中识别出了数万个开放表单评论页面,并且现代僵尸网络可以大规模自动化表单提交,所需的注入量是可以实现的。

受控实验证实了效果

研究人员并未止步于流水线分析。他们在来自 Dolma 3 的网络数据中,以 0.1%、0.01% 和 0.001% 的 token 比例混合了微量的评论式投毒内容,并预训练了五种参数规模的模型(65M、150M、260M、709M 和 1.3B)。投毒内容由提示-完成对组成,这些对始终偏向于三组实体对中的一组(波音 vs 空客、雪铁龙 vs 雷诺、辉瑞 vs 莫德纳)。

在最高投毒率(0.1%)下,基础模型显示出向偏好实体偏移了 +18 到 +20 个百分点。经过对有安全指示微调数据集的监督微调(SFT)后,较小模型保留了大约 40% 的效果,而较大模型(709M 和 1.3B)保留了不到 15%。值得注意的是,即使在 0.001% 的 token 投毒率(训练 token 的万分之一)下,基础模型仍然显示出可检测到的偏移,根据模型规模不同,偏移范围为 +3 到 +11 个百分点。

更隐秘的格式也有效

研究人员测试了三种投毒格式:标准的用户/助手聊天记录、带有通用话语标记的问答格式以及完全没有标记的无标签格式。在基础模型层面,所有三种格式在所有模型规模上都产生了几乎相同的污染效果。在 SFT 之后,无标签格式在大规模模型上失去了效果,而问答格式则保持了与完整聊天格式相当的竞争力。这一发现表明,攻击者可以通过剥离独特的标记来规避简单的模式匹配过滤器,并且仍然能够成功投毒。

那程序化广告呢?

该团队还将 HalfLife 应用于程序化广告,这是另一种可能的第三方注入机制。他们发现,广告在架构上与当前的基于文本的数据流水线不兼容:在静态 HTML 爬取(Common Crawl 使用的类型)中,广告内容尚未渲染,爬虫只能看到占位符 <ins><div> 标签。即使在渲染后的爬取中,广告文本通常也嵌入在 iframe 或图片中。研究人员得出结论,广告目前通过文本提取流水线不构成投毒风险,这证明了 HalfLife 作为诊断工具的价值:并非每个注入向量都是可行的。

缓解措施与不对称性

该论文概述了几种缓解策略。在数据流水线层面,开发者可以实现评论感知的文本提取(将用户提交的内容与主页面内容区别对待)、来源感知过滤(降低带有开放表单页面的权重)和时间一致性检查(比较同一页面在不同爬取时期的快照)。在平台层面,网站运营者可以采用经过认证的发布系统、速率限制以及能够检测重复评论模式的审核工具。

研究人员还指出一个重要不对称性:资源匮乏的语言和开放数据模型面临不成比例的更大风险。攻击者可以在网络中被抓取较少的角落实现更高的投毒饱和度,而像 OLMo、DCLM 和 FineWeb 这样的开放模型的完整文档化流水线则为攻击者提供了优化其注入的蓝图。该团队未测试这些细节在多大程度上可被利用来提高纳入率,但论文将此作为一个开放性问题提了出来。

该研究的主要局限性在于它没有在真实网站上进行实时注入实验,团队使用了沙盒化的本地 WordPress 实例并模拟替换了现有评论文本。纳入估计基于单一数据管理流水线(Dolma 3);其他流水线可能产生不同的概率。主要 AI 实验室的生产级爬虫在范围、频率和过滤方面也可能与 Common Crawl 有所不同。

尽管如此,核心结论依然成立:普通的评论区是语言模型预训练中一个可行、可扩展且难以防御的攻击面。研究人员提醒关注非英语模型训练中资源不足社区面临的不成比例的风险,并敦促流水线开发者开始将用户提交的网络内容视为一个明确的威胁面,不仅仅是作为需要过滤以提高质量的噪声,而是作为针对机器的计算宣传的蓄意向量。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。