计算机视觉
CABiNet以八分之一算力将差距保持在YOLO26x的2个百分点以内
VDD语义分割模型库将基于多样化无人机影像训练的YOLO26和CABiNet模型带到Hugging Face。YOLO26x-sem以78.83%的mIoU领跑,但CABiNet-Large在54.8 GFLOPs下取得77.76%的成绩,为效率优势提供了论据。

新的VDD语义分割模型库中最具启发性的数字并不是排行榜顶部的那个。YOLO26x-sem以78.83%的平均IoU领跑整个模型库。紧随其后的是CABiNet-Large,mIoU为77.76%,其算力需求为54.8 GFLOPs,而领先者需要430.9 GFLOPs。准确率差距约为1个百分点,算力差距约为八倍。
该模型库是以dronefreak账号发布的开源Hugging Face集合,其既定目标是通过在统一流水线下提供开箱即用的预训练权重,让航空语义分割的基准测试变得更加容易。两个模型家族均基于Varied Drone Dataset训练,该数据集以RussRobin/VDD发布。此次发布涵盖从Nano到XLarge的YOLO26语义分割变体,以及一个基于MobileNetV3-Large骨干网络的CABiNet基线模型。
54.8 GFLOPs对比430.9:对无人机真正重要的差距
对于航空感知而言,算力成本并非抽象指标。无人机依赖电池和边缘推理硬件运行,GFLOPs削减八倍足以区分一个能投入部署的模型和一个永远走不出实验室的模型。54.8 GFLOPs的检查点为系统设计者留出余地,可以在中等配置的硬件上运行网络;而430.9 GFLOPs的检查点则把同样的工作推向地面站或重型机载计算。对操作者来说,78.83%与77.76%的mIoU差异,远不如这两个功耗包络之间的差异重要。
| 模型 | mIoU | GFLOPs |
|---|---|---|
| YOLO26x-sem | 78.83% | 430.9 |
| CABiNet-Large | 77.76% | 54.8 |
CABiNet-Large以一小部分算力将差距保持在最佳YOLO26结果的1-2个百分点以内,这正是实践中决定实时分割选型的那类权衡。GFLOPs只是一个代理指标,并非全部答案:本次发布未报告延迟或内存数据,因此效率论证仅基于算力数字。按照模型库自身的数据,这个轻量级模型以大约1个百分点的准确率换取了大部分算力的节省。
VDD在多种高度、视角和场景上进行训练
基准设计的重要性不亚于模型数量。VDD混合了多种高度、视角和场景类型,涵盖城市、乡村和自然环境。该发布将这一定位描述为比单一航线的无人机影像更困难、更多样化的设置, , 后者只会让模型习惯于一个视角。一个能在高度变化和视角变化下保持性能的语义分割模型,比一个只针对单一飞行剖面调优的模型更能反映真实无人机作业的情况,这正是以这种方式构建数据集的实际价值。
模型卡承担可复现性的重任
每张模型卡都附带评估指标、逐类IoU、混淆矩阵、RGB、Ground-Truth与Prediction的定性对比,以及所使用的训练配置。RGB、Ground-Truth与Prediction对比是真正实用的部分:它们展示模型在哪些地方失败,而不仅仅是在分数上落在何处。对于从事无人机感知、自主无人机、机器人、遥感或实时语义分割的团队来说,这些文档将整个模型库变成了一个对比基线,而不是一堆检查点。
本次发布未说明的内容
有三个信息缺口值得指出。该发布帖未包含模型的发布日期。它未说明推理延迟或内存占用,这使得GFLOPs成为唯一的算力数据。此外,也没有在实际无人机硬件上的部署基准测试。这些都不改变已发布数据中核心的权衡关系,但意味着实际结论将来自运行权重本身,而不是阅读模型库页面。
模型已在模型库页面公开,数据集以RussRobin/VDD列出,发布方欢迎反馈、Bug报告和贡献。
该模型库真正的贡献是一套简洁的对比集合:两种架构、一系列模型尺寸、一条共享流水线,以及一个为让准确率在多种高度和场景下依然可靠而构建的数据集。排行榜的桂冠属于YOLO26x-sem,而FLOPs数字则为落后其一个百分点的那个模型提供了论据。
- 来源 : CABiNet stays within 2 points of YOLO26x at an eighth of the compute — 2026-08-02
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。