SevenTnewS

Visión por Computadora

CABiNet se mantiene a menos de 2 puntos de YOLO26x con la octava parte del cómputo

El VDD Semantic Segmentation Model Zoo trae a Hugging Face modelos YOLO26 y CABiNet entrenados con metraje variado de drones. YOLO26x-sem lidera con 78.83% de mIoU, pero el 77.76% de CABiNet-Large a 54.8 GFLOPs plantea el caso de la eficiencia.

Emmanuel Fabrice Omgbwa Yasse Asistido por IA

2026-08-07 · 4 min de lectura

CABiNet se mantiene a menos de 2 puntos de YOLO26x con la octava parte del cómputo

El número más instructivo del nuevo VDD Semantic Segmentation Model Zoo no es el que encabeza la tabla. YOLO26x-sem lidera la colección con un IoU medio del 78.83%. Justo detrás se sitúa CABiNet-Large con 77.76% de mIoU, y ese modelo funciona con 54.8 GFLOPs frente a los 430.9 del líder. La brecha de precisión es de aproximadamente un punto. La brecha de cómputo es de aproximadamente ocho veces.

El zoo es una colección de Hugging Face de código abierto publicada bajo el usuario dronefreak, y el objetivo declarado es facilitar la evaluación comparativa de la segmentación semántica aérea al ofrecer pesos preentrenados listos para usar bajo un mismo pipeline compartido. Ambas familias de modelos se entrenaron con el Varied Drone Dataset, publicado como RussRobin/VDD. El lanzamiento abarca variantes de segmentación semántica de YOLO26 desde Nano hasta XLarge, además de una línea base CABiNet construida sobre un backbone MobileNetV3-Large.

54.8 GFLOPs frente a 430.9: la brecha que importa para los drones

El costo aritmético no es una métrica abstracta para la percepción aérea. Los drones funcionan con baterías y hardware de inferencia en el borde, y una reducción de ocho veces en GFLOPs puede separar un modelo que cabe en un despliegue de uno que nunca sale del laboratorio. Un checkpoint a 54.8 GFLOPs deja al diseñador de sistemas margen para ejecutar la red en hardware modesto; un checkpoint de 430.9 GFLOPs empuja el mismo trabajo hacia estaciones terrestres o cómputo embarcado pesado. Para un operador, la diferencia entre 78.83% y 77.76% de mIoU rara vez importa tanto como la diferencia entre esos dos niveles de consumo.

ModelomIoUGFLOPs
YOLO26x-sem78.83%430.9
CABiNet-Large77.76%54.8

CABiNet-Large se mantiene a 1-2 puntos del mejor resultado de YOLO26 con una fracción del cómputo, el tipo de compromiso que en la práctica decide las opciones de segmentación en tiempo real. Los GFLOPs son una aproximación, no la respuesta completa: el lanzamiento no informa cifras de latencia ni de memoria, por lo que el caso de eficiencia se apoya únicamente en la aritmética. Según los propios números del zoo, el modelo ligero sacrifica aproximadamente un punto de precisión para ahorrar la mayor parte del cómputo.

VDD se entrena a través de altitudes, puntos de vista y escenas

El diseño del benchmark importa tanto como la cantidad de modelos. VDD combina altitudes variadas, puntos de vista y tipos de escenas que cubren entornos urbanos, rurales y naturales. El lanzamiento describe ese rango como un entorno más difícil y diverso que el metraje de UAV de un solo vuelo, donde un modelo solo se siente cómodo con un único punto de vista. Un modelo de segmentación que se mantiene a través de cambios de altitud y ángulos de visión tiene más que decir sobre operaciones reales de drones que uno ajustado a un solo perfil de vuelo, que es el valor práctico de un conjunto de datos construido de esta manera.

Las fichas de modelo asumen la carga de la reproducibilidad

Cada ficha de modelo incluye métricas de evaluación, IoU por clase, matrices de confusión, comparaciones cualitativas de RGB, Ground-Truth y Predicción, y las configuraciones de entrenamiento utilizadas. Las comparaciones RGB, Ground-Truth y Predicción son la parte práctica: muestran dónde falla un modelo, no solo dónde queda en una puntuación. Para equipos que trabajan en percepción con UAV, drones autónomos, robótica, teledetección o segmentación semántica en tiempo real, esa documentación convierte la colección en una línea base de comparación en lugar de un montón de checkpoints.

Lo que el lanzamiento no dice

Vale la pena señalar tres vacíos. El post no incluye fecha de lanzamiento de los modelos. No indica latencia de inferencia ni huella de memoria, lo que deja los GFLOPs como única cifra de cómputo. Y no hay un benchmark de despliegue en hardware real de drones. Nada de eso cambia el equilibrio central de los números publicados, pero significa que el veredicto práctico vendrá de ejecutar los pesos, no de leer la página de la colección.

Los modelos son públicos en la página de la colección, el dataset está listado como RussRobin/VDD, y el lanzamiento invita a enviar comentarios, informes de errores y contribuciones.

La contribución real del zoo es un conjunto de comparación limpio: dos arquitecturas, una escalera de tamaños de modelo, un pipeline compartido y un dataset construido para hacer que la precisión funcione a través de altitudes y escenas. La tabla de clasificación corona a YOLO26x-sem. El conteo de FLOPs defiende al modelo que está un punto detrás.

Lo esencial de la tecnología en 3 minutos cada mañana

Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.