SevenTnewS

IA physique

Le modèle à 4 milliards de paramètres pour périphériques Edge de Nvidia fait ce que la plupart des petits VLM ne font pas

Le Cosmos 3 Edge de Nvidia intègre la modélisation du monde en 4 milliards de paramètres, se classant premier au VANTAGE-Bench parmi sa catégorie de taille. Sa conception à double transformateur mêle raisonnement et prédiction d'action en temps réel pour les robots, le tout déployable sur le matériel Jetson et RTX.

Emmanuel Fabrice Omgbwa Yasse Assisté par IA

2026-07-28 · 5 min de lecture

Le modèle à 4 milliards de paramètres pour périphériques Edge de Nvidia fait ce que la plupart des petits VLM ne font pas
Sources : Nvidia Cosmos 3…

Nvidia a publié Cosmos 3 Edge sur Hugging Face aujourd'hui, un modèle de monde ouvert à 4 milliards de paramètres conçu pour les appareils périphériques comme les modules Jetson T2000 et T3000 récemment annoncés. Le modèle vise à faire pour la robotique embarquée de petite taille ce que les versions plus grandes de Cosmos font pour l'IA physique basée sur le cloud : aider les machines à comprendre ce qu'elles voient, à prédire ce qui se passera ensuite et, surtout, à générer des actions en temps réel.

Le chiffre qui saute aux yeux est le nombre de paramètres. Avec 4 milliards, Cosmos 3 Edge évolue dans une partie relativement modeste du spectre de taille des modèles, suffisamment petit pour tenir sur un seul GPU RTX ou un module Jetson, tout en revendiquant le meilleur débit et la meilleure précision de sa catégorie parmi les modèles de même taille. Nvidia affirme qu'il se classe premier au VANTAGE-Bench pour l'analyse visuelle et établit un nouvel état de l'art pour l'apprentissage des politiques robotiques. Ces affirmations ne sont pas vagues : VANTAGE-Bench est un benchmark public pour l'analyse visuelle, et la revendication de politique robotique fait référence à des tâches de contrôle où le modèle produit 32 actions par inférence à 15 Hz sur Jetson Thor.

Deux transformateurs, un cerveau partagé

La conception est l'histoire. Cosmos 3 Edge empile deux tours de transformateur, autorégressive et diffusion, qui partagent un ensemble commun de couches d'attention multimodales mais conservent des couches de normalisation et MLP séparées. La tour autorégressive traite les jetons visuels et textuels pour la compréhension et le raisonnement. La tour de diffusion gère les jetons visuels, audio et d'action pour la prédiction et la génération. Les jetons circulent différemment selon le mode : le langage utilise une attention causale (chaque jeton ne voit que les jetons précédents), tandis que les jetons de diffusion s'intéressent plus largement au contexte disponible.

Graphique : Comparaison de la taille des modèles des petits VLM
Cosmos 3 Edge, avec 4 milliards de paramètres, est plus petit que les VLM ouverts concurrents Qwen2.5-VL (7B) et Llama 3.2 Vision (11B) selon l'article.

Cette configuration à double tour est importante car elle signifie que le modèle peut d'abord raisonner sur une scène, puis générer une sortie, que cette sortie soit une légende textuelle, une trame vidéo prédite ou un angle d'articulation de robot. La plupart des petits VLM se limitent à la légende ou au Q&R. Ils ne produisent pas de séquences d'actions. Cosmos 3 Edge le fait, et il le fait en mappant différentes incarnations, la pose de l'effecteur final d'un bras robotique, le mouvement d'un véhicule, l'état de préhension d'une pince, en une représentation d'action commune de vecteurs de translation, rotation et état de manipulation.

Mode politique : prédire et agir ensemble

Le modèle est livré avec une variante post-entraînée appelée Cosmos 3 Edge Policy (DROID), affinée sur l'ensemble de données DROID pour les tâches de prise et de dépôt. En mode politique, il prédit une action ainsi que sa conséquence visuelle attendue. Nvidia indique que les développeurs peuvent utiliser un petit cluster de H100 ou un DGX Station pour affiner le modèle à 4 milliards pour leurs propres flux de travail, puis le déployer sur du matériel périphérique.

L'avantage des poids ouverts est que vous possédez le déploiement. L'inconvénient est que vous êtes responsable de l'obtention d'une latence en temps réel à partir d'un transformateur de 4 milliards sur un module Jetson, ce qui est difficile, mais Nvidia connaît suffisamment bien son propre matériel pour publier des directives en même temps que le modèle. La société a également publié les points de contrôle de distillation Cosmos 3 Super 4-Step, qui réduisent les étapes de diffusion de 35, 50 à 4, offrant jusqu'à 25 fois plus rapide d'inférence pour les tâches texte-vers-image et image-vers-vidéo. Cette recette de distillation est un modèle séparé de 64 milliards, pas la variante Edge à 4 milliards, mais elle indique un schéma : Nvidia construit une famille d'outils de post-entraînement, pas seulement des dépôts de points de contrôle.

Comparaison

Cosmos 3 Edge n'est pas un concurrent direct des modèles fermés de pointe comme GPT-4o ou Gemini, car il n'a pas besoin de généraliser sur l'ensemble de l'internet. Il est conçu pour un créneau plus étroit : les usines, les entrepôts, les couloirs d'hôpitaux, tout endroit où une caméra et un bras robotique coexistent. La concurrence intéressante concerne les autres petits VLM ouverts revendiquant des capacités robotiques, notamment Qwen2.5-VL (7B, mais pouvant être quantifié) et les diverses versions affinées de Llama 3.2 (11B vision). L'avantage de Nvidia est architectural : la conception à double tour avec attention multimodale partagée et sortie d'action native n'est pas quelque chose que vous obtenez d'un VLM standard. La plupart des politiques robotiques construites sur un VLM ajoutent une tête d'action séparée par-dessus. Cosmos 3 Edge intègre l'action dans la représentation dès le départ.

Le compromis est que vous avez besoin du matériel Nvidia pour le faire fonctionner correctement. Le modèle a été explicitement conçu pour RTX, Jetson et DGX. C'est pratique si votre pile fonctionne déjà sur Nvidia, moins si vous optimisez pour une puce périphérique différente.

Ce que cela signifie pour le domaine de la robotique

Les chercheurs en robotique demandaient depuis longtemps des modèles de monde ouverts et compacts pouvant fonctionner sur l'appareil et produire des actions, pas seulement des descriptions. Cosmos 3 Edge répond à cette demande, mais il impose également un coût de main-d'œuvre à l'utilisateur : le modèle est une base, pas une solution clé en main. Vous avez toujours besoin de données spécifiques au domaine, de calcul pour l'affinage et de matériel robotique pour boucler la boucle. Les scripts d'entraînement ouverts que Nvidia a publiés en parallèle du modèle visent à abaisser cette barrière, mais ils ne l'éliminent pas.

Quelques questions ouvertes subsistent. Nvidia n'a pas publié de chiffres de latence pour les Jetson T2000 ou T3000 ; l'annonce indique que le modèle atteint un contrôle en temps réel à 15 Hz sur Jetson Thor, mais la plupart des déploiements périphériques fonctionneront sur les modules plus petits. Le classement VANTAGE-Bench est auto-déclaré dans la publication. Et bien que l'architecture à double tour soit élégante sur le papier, des benchmarks indépendants diront si les couches d'attention partagées créent un goulot d'étranglement pour l'une des tours lorsque les deux sont actives. Ces détails détermineront si Cosmos 3 Edge devient le modèle de monde périphérique par défaut ou reste une conception de référence prometteuse que peu d'équipes déploient complètement.

L'essentiel de la tech en 3 minutes chaque matin

Un email, chaque jour ouvré, avec ce qui compte vraiment en IA et en tech.