SevenTnewS

开放性探索与视觉语言模型

Sakana AI的Picbreeder实验揭示视觉语言模型对人类创造力的理解缺失

由Sakana AI领导的研究团队用视觉语言模型替换了Picbreeder的人类用户,发现合成存档缺乏人类原版的胆识和多样性。他们利用噪声、记忆以及数千个提示生成的个性进行的实验,揭示了将大模型用于开放性发现的潜力与局限。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-07-20 · 阅读需 6 分钟

Sakana AI的Picbreeder实验揭示视觉语言模型对人类创造力的理解缺失
来源 : In Search of th…

开放性探索是人工智能创造力的圣杯:一个能够不断生成新颖、有意义的产物而不会收敛到单一解决方案的系统。自然进化做到了。人类文化做到了。AI系统大多做不到。来自Sakana AI、纽约大学和麻省理工学院的研究人员发表的一篇新论文,直接瞄准了这个问题。他们复现了Picbreeder, , 人类驱动的经典进化艺术平台, , 用视觉语言模型代替人类用户。该论文已被2026年GECCO会议接收。

结果具有启发性。视觉语言模型生成的存档比人类原版更平淡、更重复、更乏味。但这项由Sam Earle(纽约大学)主导,Kai Arulkumaran、Andrew Dai、Akarsh Kumar、Julian Togelius和Sebastian Risi共同参与的研究,还系统性地测试了哪些干预措施可能缩小这一差距,使其成为迄今为止最严谨的尝试之一,旨在分离机器系统中开放性探索的要素。

Picbreeder测量了什么

Picbreeder于2008年推出,允许用户通过选择和变异CPPN生成的图像来共同进化图像,并彼此之间的创作产生分支。多年来,社区构建了一个丰富的已发布图像系统发育树, , 包括人脸、汽车、昆虫、抽象图案, , 这成为了人类驱动的开放性搜索的基准。Kumar等人在2025年整理的数据集包含9758张已发布图像及其完整祖先谱系,为Sakana团队提供了一个直接的人类基线进行衡量。

核心实验用视觉语言模型智能体(默认使用Gemini 2.5 Pro,在测试了包括Gemini 3 Pro、Qwen3-VL变体及Flash模型在内的多个模型后确定)替换每个人类用户。智能体看到一个由15张CPPN图像组成的群体,在20代中选择父母,并将最终图像发布到共享存档中。分支从现有存档的样本开始。十个智能体并行运行。论文称这是对原始实验条件的忠实复现,而非试图复现其结果。

人类与视觉语言模型输出之间的差距一目了然。人类存档拥有更多种类和更清晰、更有意境的图像。视觉语言模型产生大量近乎重复的图片,倾向于模式坍塌(重复少数几种形式),并且常常发布灰色、抽象或高频噪声。该论文试图用四个指标量化这一差距:语义召回(存档覆盖来自THINGS数据集的已知物体类别的程度)、视觉覆盖和语义覆盖(嵌入空间中的k-覆盖半径)以及树平衡(系统发育平衡的J1指数)。人类基线在所有三个覆盖指标上领先,并在召回率上与视觉语言模型持平。随机选择表现最差。

三项干预措施,三个教训

图表:覆盖指标:人类 vs 视觉语言模型 vs 随机
根据Sakana AI的研究,人类基线在所有三个覆盖指标上领先,并在召回率上与视觉语言模型持平,随机选择表现最差。

团队改变三个参数:探索性噪声(ε-贪婪选择)、上下文长度(视觉语言模型看到的先前交互历史量)以及通过大语言模型提示生成的独特智能体个性数量。

探索与质量

没有噪声时,视觉语言模型存档遭受严重的模式坍塌, , 如论文所述:许多类似的狐狸或鱼骨形状的变体。注入高达0.25的ε-贪婪噪声可在不牺牲召回率的情况下提高多样性,但更大的噪声水平会降低图像质量。即使在epsilon=1的情况下,视觉语言模型仅处理分支和评分,所有选择都是随机的,存档仍然在几个指标上优于随机基线,这表明即使控制力最低,视觉语言模型也能有意义地引导。但树平衡指数仍然顽固地低:视觉语言模型反复从相同的图像分支,而不是从随机群体开始。

记忆是一把双刃剑

上下文长度为零(无历史记录)时,由于智能体发布重复内容,召回率崩溃。上下文长度为1时,智能体看到当前回合和前一回合,表现恢复良好。但将上下文扩展到2、10或完整的20代会话时,召回率和覆盖指标持续下降。在完整上下文的情况下,智能体有时会在多个种子中生成近乎照片真实的易拉罐图像,但整体存档变得噪声更大。作者推测存在信息过载和自循环, , 视觉语言模型强化自身陈述的偏好,而非广泛探索。

多智能体,奇怪的结果

将不同的提示个性数量从1扩展到1000,显著提高了语义覆盖和树平衡。任何设置中最高语义覆盖指标来自1000智能体的条件。但存档中也充斥着高频、无法解读的迷幻图案,这些图案占发布物的10%到20%,论文称之为对抗性图像, , 被多个向不同方向拉动的智能体“打磨”而成。那种可能推动智能体进行大胆跳跃的协作摩擦,反而将它们推向噪声。

从数量上看,1000智能体网格是最明显的开放性系统;从质量上看,它也是最陌生的。这种张力可能是论文最深刻的成果:旨在捕捉人类重视的多样性的指标,无法区分一种精炼的新颖形式和一种偶然映射到许多标题嵌入的对抗性故障。作者将此标记为未来工作的方向,并提出一种语义方差指标, , 给定图像的标题在重复的视觉语言模型标题中的变化程度, , 来区分两者。

Sakana的角度

Sakana AI的参与并非偶然。这家位于东京的实验室由David Ha和Llion Jones共同创立,其研究议程围绕生物启发式开放系统展开, , 从进化模型合并到自我复制神经网络。这项Picbreeder研究完全符合该计划:它将开放性探索视为一组可以通过用模型替换人类来探究的设计决策,而不是事后测量的属性。

论文谨慎地避免声称其系统是开放的。它报告了是什么让视觉语言模型驱动的系统比人类版本更不开放,以及哪些设计选择使其更接近开放。这是一个有用的贡献。结果表明,没有单一的解决方案, , 更多的噪声、更多的记忆、更多的智能体, , 能实现类似人类的开放性;组合可能至关重要,论文明确呼吁在更大规模上同时测试这些干预措施。

这对自动化的意义

该研究的更广泛影响在于任何用AI自动化创意或科学探索的项目。如果视觉语言模型, , 即使是前沿模型, , 在相同的最小结构下产生的搜索范围比人类更窄,那么在开放流水线中用机器判断替代人类判断可能需要精心设计辅助框架。Sakana团队表明,辅助框架很重要:适量的记忆、适量的噪声注入、适量的观点多样性。但它也表明,仅靠辅助框架尚无法复制人类的胆识, , 那种论文称之为X因素的质量,涉及更大的语义飞跃和更敏锐的辨别力。

对于构建用于内容生成、游戏世界设计或科学假设探索的智能体系统的从业者来说,教训是:开放性系统不是模型属性,而是系统属性。视觉语言模型本身不是瓶颈;其环境、记忆、选择规则和群体多样性的设计才是开放行为成败的关键。

Sakana团队的代码已在GitHub上发布。来自原始Picbreeder实验的数据仍然是人类引导进化最丰富的行为痕迹之一。正如这篇论文所做的,将两者连接起来,是理解我们所说的创造力含义的一步。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。