Publicités

    Top 5

    Articles similaires

    Cosmos 3 Edge : ce que le modèle monde de NVIDIA change pour la robotique embarquée

    NVIDIA a mis à disposition Cosmos 3 Edge, un modèle monde ouvert de 4 milliards de paramètres conçu pour la robotique et les agents de vision qui travaillent au plus près des capteurs. Présenté à SIGGRAPH puis publié dans le dépôt Cosmos 3 de Hugging Face, il ne vise pas à remplacer un agent généraliste : son rôle est de représenter une scène physique, d’en suivre les changements et de produire des actions dans un environnement embarqué.

    Le déplacement est important pour la robotique et l’infrastructure : au lieu d’envoyer systématiquement les flux vers un centre de données, NVIDIA cherche à faire tenir une partie de la perception, du raisonnement et de l’action sur des machines edge compatibles, dont Jetson, RTX PRO, DGX et GeForce RTX.

    Un modèle monde, pas un robot autonome généraliste

    Un modèle monde apprend à représenter des objets, des mouvements, des relations spatiales et les effets possibles d’une action. Dans le cas d’un bras robotisé, reconnaître un objet ne suffit donc pas : le système doit aussi relier sa position, le mouvement de la pince et ce qui peut se produire au contact.

    Cosmos 3 Edge est présenté comme un modèle compact capable de traiter texte, image, vidéo, son ambiant et action. La cible annoncée n’est pas une conversation longue ou un assistant universel, mais des tâches où une machine doit interpréter une situation visuelle et réagir dans un délai compatible avec l’usage local.

    Ce que mesurent les chiffres annoncés

    Élément publié Lecture utile
    4 milliards de paramètres Un format que NVIDIA présente comme compact pour un modèle monde destiné au déploiement edge.
    640 × 360 La résolution d’observation annoncée pour le fonctionnement comme modèle d’action post-entraîné.
    32 actions par inférence Le nombre d’actions générées par inférence dans cette configuration publiée.
    15 Hz sur Jetson Thor La cadence de contrôle en temps réel annoncée par NVIDIA pour cette configuration.
    VANTAGE-Bench NVIDIA revendique la première place parmi les modèles de taille comparable, 4B, pour l’analyse visuelle.

    Ces résultats décrivent une configuration et un benchmark précis. Ils donnent un repère sur l’objectif de performance embarquée ; ils ne suffisent pas, à eux seuls, à établir la fiabilité d’un robot dans tous les environnements réels.

    L’enjeu concret : spécialiser le modèle au lieu de tout centraliser

    NVIDIA prévoit que les développeurs post-entraînent Cosmos 3 Edge avec leurs propres données de robots et de capteurs afin de construire des modèles d’action adaptés à un cas d’usage. La même annonce cite notamment la manipulation et la locomotion parmi les politiques de contrôle visées.

    À retenir : l’intérêt de Cosmos 3 Edge tient moins à une promesse d’autonomie générale qu’à une chaîne plus courte entre perception locale, modèle spécialisé et action. Les éléments publiés documentent le modèle, ses mesures et son accès ; ils ne présentent pas de validation indépendante de sûreté sur un déploiement réel donné.

    Sources

    LAISSER UN COMMENTAIRE

    S'il vous plaît entrez votre commentaire!
    S'il vous plaît entrez votre nom ici