SevenTnewSAI 与科技新闻,深度解读

红外相机AI · 物种识别基准测试,2026年9月

BioCLIP以3亿参数量,在物种识别上击败更大的视觉模型

在包含96个物种的任务中,一个3亿参数的专用模型表现优于四个参数规模在20亿至80亿之间的视觉语言模型。同一项研究还发现,野外影像会令所有模型性能下降,且高达9.6%的开放集回答给出了并不存在的物种名称。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-09-21 · 阅读需 4 分钟

BioCLIP以3亿参数量,在物种识别上击败更大的视觉模型

红外相机运行在一种被大多数模型评测所忽视的约束之下。它部署在野外,运行于算力有限、连接时断时续甚至完全没有网络的边缘硬件上,因此一个无法在本地运行的视觉语言模型根本不在候选之列。9月10日发布在arXiv上的一篇论文的作者以这一约束为出发点,测试的是与部署相关的模型类别,而非前沿模型:四个参数规模在20亿至80亿之间的视觉语言模型(VLM)。

参评阵容为20亿、40亿和80亿参数的Qwen3-VL,外加Gemma3 4B,全部与BioCLIP对比评判, , 后者是一个拥有3亿参数的领域专用模型。任务覆盖96个物种,在干净的iNaturalist照片上,所有模型识别这些物种的表现都远高于随机水平。来自六个红外相机图像集的野外影像则对它们没那么客气,领域差距在9.6至26.6个百分点之间。这种性能崩塌并非本研究独有。另一项涵盖十项原子视觉能力的基准测试发现,没有任何前沿模型能越过60%的关口,详见PerceptionBench的结果

评测测量了什么

测量项结果
专用模型BioCLIP,3亿参数
受测通用视觉语言模型Qwen3-VL 2B、4B、8B;Gemma3 4B
任务涉及的物种96
评测集两套,独立采样
领域差距:干净照片到野外影像9.6至26.6个百分点
BioCLIP相对每个受测VLM的优势33.2至59.2个百分点(基于200张图像的样本)
BioCLIP自身的领域差距18.0个百分点,最佳VLM为22.3个百分点
给出不存在物种的开放集回答5.9%至9.6%

这一对比在两套独立采样的评测集上运行,性能退化在两套评测集上、在各个分类层级上都成立。构建一个能经受此类重采样的评测需要付出不少功夫,而随着静态答案库失去效力,这正是该领域演进的方向,详见对饱和基准的告别

为什么3亿参数的专用模型跑赢了80亿参数的通用模型

在扩展后的200张图像样本上,BioCLIP比所有受测VLM高出33.2至59.2个百分点。它同时也是全场最小的模型:3亿参数,而最大的Qwen3-VL变体为80亿参数。作者将这一优势归因于专门的训练数据,而非规模。这与小体量、窄领域训练的模型足以与远大于自己的模型相抗衡的更广泛趋势相呼应,这一趋势见于2亿参数以下模型的繁荣

这一解读改变了任何构建野外分类器的人的工作重心所在。规模差距可以通过购买更大的硬件或等待下一代通用模型来弥合。数据差距则必须通过领域语料库和一次训练来弥合,而3亿参数微调所需的算力开销,是这项工程中较便宜的那一半。

高达9.6%的开放集回答给出了并不存在的物种

开放集提示将模型推到了它们被训练去做选择的选项之外。有5.9%至9.6%的回答返回了句法上成立但在分类学上并不存在的物种名称:这些字符串形态上与林奈双名法完全一致,却指向不存在的生物。

点估计值会有波动,但排序没有变。每个模型相对的捏造率在两套独立采样的数据集上完全复现,论文将这一排序视为比其中任何一个单独数字都更可靠的结果。

专用模型也在下降,幅度几乎相同

从干净照片到野外图像的崩塌,看起来可能是通用模型的问题。事实并非如此。BioCLIP自身的领域差距为18.0个百分点,与表现最好的VLM的22.3个百分点在统计上无法区分。按论文的解读,这一降幅跟踪的是图像的可辨识程度,而非区分相似物种的失败,这也是它出现在每一个分类层级、每一个模型(无论是否为专用模型)上的原因。基准测试一旦移植到真实世界数据上,同样的墙就会显现:顶级模型在SWE-bench Verified上越过96%,但在私有企业代码上勉强达到23%,详见那项领域差距审计

一台没有信号的红外相机继承了什么

论文止步于分类。它没有追踪输出进入生物多样性数据库之后的情形,也没有测量一旦标签被记录下来,9.6%的捏造率会给一次调查带来什么。一条在无人工介入情况下记录模型输出的流水线,会继承模型所带有的任何错误率,而就这项证据而言,错误率恰好在其部署发生的地方达到峰值。

但决定性因素出现在一个出人意料的地方。规模并不是将BioCLIP与那些VLM区分开的变量;训练数据才是。对于为边缘设备挑选物种分类器的团队而言,参数数量是那个不那么有趣的数字。真正值得问的问题是:这个模型是在哪些图像上训练的。BioCLIP那18.0个百分点的野外损失是论文中最不起眼的结果,但可以说也是最有用的:专用模型解决的是识别问题,而不是摄影问题。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。