SevenTnewS

AI垃圾内容

没人能定义AI垃圾内容。这个开放数据集正在用平均分作答

SlopFinder收集对AI生成文本的一键匿名投票,并将平均结果导出到Hugging Face。该项目的理念是:即使‘垃圾内容’无法被定义,它也是可测量的,这使得后续构建更容易。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-08-18 · 阅读需 5 分钟

没人能定义AI垃圾内容。这个开放数据集正在用平均分作答

SlopFinder是一个早期MVP,借鉴了一个经过验证的思路,并将其对准一个没人成功定义过的术语。这个经过验证的思路是众包感知:给人们展示某样东西,收集一个评分,然后继续。目标是AI垃圾内容, , 这个标签主导着评论区与平台政策讨论,但一旦有人试图把它明确界定,它就会瓦解。

其机制刻意保持极简。该项目从现有数据集中提取AI生成文本的样本,匿名展示,并为每位访客收集一个评分:一个单独的控件,询问该文本有多垃圾。没有分类,没有表单。一旦某个样本积累了足够多的投票,它就会被作为开放数据导出到Hugging Face,供任何人使用。团队称这是一个早期MVP,数据集很小,系统仍在进化中。

SlopFinder实际测量的是什么

从定义转向测量才是真正的重点。该项目自身的表述很明确:SlopFinder并不是在定义垃圾内容,而是在测量人类所谓垃圾内容的感知平均版本。这个数据集是许多工作定义的集合,有些接近客观,有些则纯粹是个人品味。

这个赌注有一个行之有效的先例。LMSYS Chatbot Arena通过盲测人类偏好,以Elo评分对模型进行排名,目前近500万张投票将顶尖实验室挤在25分的区间内。Arena从未为了给模型排名而定义‘好’。SlopFinder押注同样的逻辑在质量的低端也成立。

为什么垃圾内容无法被固定定义

一位早期贡献者的评论解释了为什么这个词无法固定下来。对某些读者来说,垃圾内容只是意味着低质量或不用心。对另一些人来说,它与一种具体的失败模式相关:生成图像中手或眼睛破坏了幻觉,即使在炭笔或素描等风格化输出中也是如此。同一位评论者估计,生成图像中可原样使用的比例大约为四十分之一。

另一个比较来自游戏领域:商店里满是这位评论者所称的‘新手入门FPS’项目,这些项目由购买的源代码、素材翻新、手绘纹理和一张薄弱的地图拼凑而成,然后被出售,而不是被当作迈向更好作品的阶梯。破碎的手是一个客观缺陷。懒惰的素材翻新是对努力和意图的判断。可玩性是第三个维度:令人愉快的內容有价值,而破坏基本逻辑的输出‘会让大脑感到疼痛’。一个定义必须同时涵盖这三个方面,这正是该项目拒绝写出一个定义的原因。

在企业侧,信任也以同样的方式被侵蚀。Aleph Alpha警告说,通用的AI试点项目通过一种过度承诺与交付不足的模式削弱信任,它称这种现象为‘enshittification’(垃圾化)。按照这种解读,垃圾内容就是同一失败模式面向消费者的版本。

将模糊投票平均化的风险

聚合模糊判断的代价是真实存在的,该项目对此也坦然承认。一次快速评分将真实的缺陷检测与个人品味混在一起。在标注池较小的情况下,平均值可能因少数几张投票而大幅波动,而且只有在未指定数量的评分累积之后才会导出。

原则上,人类判断是正确的参考点。牛津大学的GauntletBench让AI智能体执行100项真实任务,结果它们失败了其中的81%;而专家级人类标注者以超过80%的准确率完成了同样的工作,论文称之为‘具有挑战性但可行’。但‘专家’一词在这里很有分量。SlopFinder的投票池是自我选择的互联网投票者,而不是经过训练的标注者,该项目并没有假装不是这样。

主要的替代方案, , 模型自我审查, , 也有其有据可查的盲区。Pine AI和华盛顿大学的研究发现,通过截图判断AI生成图形的视觉语言模型存在结构性盲区:在15张密集的学术图形渲染图中,VLM将14张评为‘完美’,而对元素几何的确定性测量则捕捉到了40%至74%的视觉缺陷,而截图指标对这些缺陷完全看不见。机器评审者无法被信任来识别垃圾内容,这正是向人类提问的最有力论据。

评审者工作方式已知盲区
SlopFinder投票池匿名一键评分,导出到Hugging Face早期池子小;品味与缺陷检测混在一起
Chatbot Arena Elo盲测人类偏好投票,总计近500万张衡量感知质量,而非其成因
VLM截图评审另一个模型审查渲染图像结构性盲区;将15张图中14张评为‘完美’

开放的垃圾内容数据集改变了什么

可测量的、公开的垃圾内容评分将成为平台已经在构建的标识经济的基础设施。Google广告带有强制性的AI标签,但在Google自身库存之外的执行基本靠自觉,平台也已开始要求广告标注AI标签。一个共享的、包含人类标记为垃圾内容的数据集,为审核系统提供了共同参考,而不是让每个平台私下定义机器生成的垃圾。

有一个值得一提的陷阱。Meena Jagadeesan及其同事的研究模拟了用户知道自己的工作将被扫描AI痕迹时的策略性反应:他们会重写、删减并加入个人特征,以削弱检测器捕获的任何信号。这些结果与检测器倡导者的预期相反。同样的逻辑也适用于公开的垃圾内容数据集。帮助平台审核的投票池,也可能成为下一波生成内容的训练信号,这些内容会被设计成刻意避开数据集记录的那些判断。

如果积累了足够的投票,SlopFinder真正的贡献是让这个类别变得清晰可读。垃圾内容不会得到一个定义。它可能会得到一个分布,而那可能更有用。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。