Vision par ordinateur
CABiNet reste à moins de 2 points de YOLO26x pour un huitième de la puissance de calcul
Le VDD Semantic Segmentation Model Zoo apporte sur Hugging Face des modèles YOLO26 et CABiNet entraînés sur des images de drones variées. YOLO26x-sem mène avec 78.83% de mIoU, mais les 77.76% de CABiNet-Large à 54.8 GFLOPs plaident en faveur de l'efficacité.
Emmanuel Fabrice Omgbwa Yasse Assisté par IA
2026-08-07 · 4 min de lecture

Le chiffre le plus instructif du nouveau VDD Semantic Segmentation Model Zoo n'est pas celui qui trône en tête du classement. YOLO26x-sem mène la collection avec 78.83% de mIoU. Juste derrière se trouve CABiNet-Large avec 77.76% de mIoU, et ce modèle fonctionne avec 54.8 GFLOPs contre 430.9 pour le leader. L'écart de précision est d'environ un point. L'écart de calcul est d'environ un facteur huit.
Le zoo est une collection Hugging Face open source publiée sous le pseudo dronefreak, et l'objectif affiché est de rendre l'évaluation comparative de la segmentation sémantique aérienne plus facile en fournissant des poids pré-entraînés prêts à l'emploi dans un pipeline commun. Les deux familles de modèles ont été entraînées sur le Varied Drone Dataset, publié sous le nom RussRobin/VDD. La publication couvre les variantes de segmentation sémantique YOLO26 de Nano à XLarge ainsi qu'un modèle de référence CABiNet construit sur un backbone MobileNetV3-Large.
54.8 GFLOPs contre 430.9 : l'écart qui compte pour les drones
Le coût arithmétique n'est pas une métrique abstraite pour la perception aérienne. Les drones fonctionnent sur batteries et sur du matériel d'inférence edge, et une réduction d'un facteur huit des GFLOPs peut séparer un modèle adapté à un déploiement d'un modèle qui ne quitte jamais le laboratoire. Un checkpoint à 54.8 GFLOPs laisse au concepteur de systèmes la marge nécessaire pour exécuter le réseau sur du matériel modeste ; un checkpoint à 430.9 GFLOPs pousse le même travail vers des stations au sol ou une puissance de calcul embarquée lourde. Pour un opérateur, la différence entre 78.83% et 77.76% de mIoU compte rarement autant que la différence entre ces deux enveloppes de puissance.
| Modèle | mIoU | GFLOPs |
|---|---|---|
| YOLO26x-sem | 78.83% | 430.9 |
| CABiNet-Large | 77.76% | 54.8 |
CABiNet-Large reste à un ou deux points du meilleur résultat YOLO26 avec une fraction de la puissance de calcul, le genre de compromis qui tranche en pratique les choix de segmentation en temps réel. Les GFLOPs sont un proxy, pas la réponse complète : la publication ne rapporte aucune mesure de latence ni de mémoire, si bien que l'argument de l'efficacité repose uniquement sur l'arithmétique. Selon les chiffres du zoo, le modèle léger sacrifie environ un point de précision pour économiser l'essentiel du calcul.
VDD : entraînement sur altitudes, points de vue et scènes variés
La conception du benchmark compte autant que le nombre de modèles. VDD mélange des altitudes variées, des points de vue et des types de scènes couvrant des environnements urbains, ruraux et naturels. La publication décrit cet éventail comme un cadre plus difficile et plus diversifié que des images UAV issues d'un seul vol, où un modèle ne se familiarise qu'avec un seul point de vue. Un modèle de segmentation qui résiste aux changements d'altitude et aux angles de vue en dit plus sur les opérations réelles de drones qu'un modèle calibré sur un seul profil de vol, et c'est là la valeur pratique d'un jeu de données construit de cette façon.
Les model cards portent le poids de la reproductibilité
Chaque model card est fournie avec les métriques d'évaluation, l'IoU par classe, les matrices de confusion, des comparaisons qualitatives RGB, Ground-Truth et Prediction, ainsi que les configurations d'entraînement utilisées. Les comparaisons RGB, Ground-Truth et Prediction constituent la partie pratique : elles montrent où un modèle échoue, et pas seulement où il se situe sur un score. Pour les équipes qui travaillent sur la perception UAV, les drones autonomes, la robotique, la télédétection ou la segmentation sémantique en temps réel, cette documentation transforme la collection en base de comparaison plutôt qu'en tas de checkpoints.
Ce que la publication ne dit pas
Trois lacunes méritent d'être signalées. La publication n'indique aucune date de lancement pour les modèles. Elle ne fournit aucune latence d'inférence ni empreinte mémoire, ce qui laisse les GFLOPs comme seule donnée de calcul. Et il n'existe aucun benchmark de déploiement sur du matériel drone réel. Rien de tout cela ne modifie le compromis central des chiffres publiés, mais cela signifie que le verdict pratique viendra de l'exécution des poids, et non de la lecture de la page de la collection.
Les modèles sont publics sur la page de la collection, le jeu de données est référencé sous le nom RussRobin/VDD, et la publication invite aux retours, aux signalements de bugs et aux contributions.
La véritable contribution du zoo est un ensemble de comparaison propre : deux architectures, une échelle de tailles de modèles, un pipeline partagé et un jeu de données conçu pour faire fonctionner la précision à travers les altitudes et les scènes. Le classement couronne YOLO26x-sem. Le nombre de FLOPs plaide en faveur du modèle situé un point derrière.
- Source : CABiNet stays within 2 points of YOLO26x at an eighth of the compute — 2026-08-02
L'essentiel de la tech en 3 minutes chaque matin
Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.