NVIDIA a mis à disposition Cosmos 3 Edge, un modèle monde ouvert de 4 milliards de paramètres conçu pour la robotique et les agents de vision qui travaillent au plus près des capteurs. Présenté à SIGGRAPH puis publié dans le dépôt Cosmos 3 de Hugging Face, il ne vise pas à remplacer un agent généraliste : son rôle est de représenter une scène physique, d’en suivre les changements et de produire des actions dans un environnement embarqué.
Le déplacement est important pour la robotique et l’infrastructure : au lieu d’envoyer systématiquement les flux vers un centre de données, NVIDIA cherche à faire tenir une partie de la perception, du raisonnement et de l’action sur des machines edge compatibles, dont Jetson, RTX PRO, DGX et GeForce RTX.
Un modèle monde, pas un robot autonome généraliste
Un modèle monde apprend à représenter des objets, des mouvements, des relations spatiales et les effets possibles d’une action. Dans le cas d’un bras robotisé, reconnaître un objet ne suffit donc pas : le système doit aussi relier sa position, le mouvement de la pince et ce qui peut se produire au contact.
Cosmos 3 Edge est présenté comme un modèle compact capable de traiter texte, image, vidéo, son ambiant et action. La cible annoncée n’est pas une conversation longue ou un assistant universel, mais des tâches où une machine doit interpréter une situation visuelle et réagir dans un délai compatible avec l’usage local.
Ce que mesurent les chiffres annoncés
| Élément publié | Lecture utile |
|---|---|
| 4 milliards de paramètres | Un format que NVIDIA présente comme compact pour un modèle monde destiné au déploiement edge. |
| 640 × 360 | La résolution d’observation annoncée pour le fonctionnement comme modèle d’action post-entraîné. |
| 32 actions par inférence | Le nombre d’actions générées par inférence dans cette configuration publiée. |
| 15 Hz sur Jetson Thor | La cadence de contrôle en temps réel annoncée par NVIDIA pour cette configuration. |
| VANTAGE-Bench | NVIDIA revendique la première place parmi les modèles de taille comparable, 4B, pour l’analyse visuelle. |
Ces résultats décrivent une configuration et un benchmark précis. Ils donnent un repère sur l’objectif de performance embarquée ; ils ne suffisent pas, à eux seuls, à établir la fiabilité d’un robot dans tous les environnements réels.
L’enjeu concret : spécialiser le modèle au lieu de tout centraliser
NVIDIA prévoit que les développeurs post-entraînent Cosmos 3 Edge avec leurs propres données de robots et de capteurs afin de construire des modèles d’action adaptés à un cas d’usage. La même annonce cite notamment la manipulation et la locomotion parmi les politiques de contrôle visées.
À retenir : l’intérêt de Cosmos 3 Edge tient moins à une promesse d’autonomie générale qu’à une chaîne plus courte entre perception locale, modèle spécialisé et action. Les éléments publiés documentent le modèle, ses mesures et son accès ; ils ne présentent pas de validation indépendante de sûreté sur un déploiement réel donné.


