Top 5

    Articles similaires

    Qwen3.8-Flash-Next : ce que la préversion de Qwen4 change pour les longs contextes et les agents IA

    Alibaba ouvre les poids de Qwen3.8-Flash-Next, un modèle multimodal qui sert aussi de préversion technique pour l’architecture annoncée de Qwen4. L’intérêt du lancement n’est pas seulement d’ajouter un modèle à poids ouverts : Qwen teste une façon de traiter les contextes très longs, un sujet central pour les assistants de code et les agents qui enchaînent des outils.

    Une préversion ouverte, pas encore un Qwen4

    Publié le 26 août sur Hugging Face et ModelScope, Qwen3.8-Flash-Next est présenté par l’équipe Qwen comme une préversion de l’architecture prévue pour Qwen4. Le fichier disponible permet donc d’examiner et d’intégrer ce choix technique avant l’arrivée d’une famille complète.

    La fiche officielle décrit un modèle de langage causal avec encodeur visuel. Son modèle principal compte 125 milliards de paramètres ; 51 milliards de paramètres d’embeddings N-gram s’y ajoutent. Seuls 6 milliards de paramètres sont activés par jeton. Capacité totale et calcul mobilisé à chaque étape sont ainsi deux grandeurs différentes.

    Le long contexte comme contrainte d’architecture

    Lorsqu’un assistant lit un dépôt de code, conserve des sorties d’outils ou suit une tâche sur de nombreuses étapes, son contexte gonfle rapidement. Qwen3.8-Flash-Next associe Gated DeltaNet et Qwen Sparse Attention pour viser ce cas d’usage. Trois couches sur quatre utilisent Gated DeltaNet, qui maintient un état récurrent de taille fixe. Qwen Sparse Attention travaille, elle, à l’échelle de micro-blocs.

    262 144 jetons natifs, jusqu’à un million avec YaRN

    Le contexte natif annoncé atteint 262 144 jetons. La fiche du modèle indique une extension possible jusqu’à un million de jetons avec YaRN. Cette spécification décrit la longueur d’entrée prise en charge ; elle ne démontre pas, à elle seule, la qualité d’un agent dans une tâche longue. Celle-ci dépend aussi des outils, du serveur d’inférence et de la construction du contexte.

    Les embeddings N-gram constituent l’autre élément mis en avant. Qwen annonce 51 milliards de paramètres dans cette composante, en plus des 125 milliards du modèle principal, tout en maintenant 6 milliards de paramètres activés par jeton. L’objectif affiché est de travailler sur la capacité et l’efficacité de calcul dans le même dessin de modèle.

    Un modèle ouvert qui doit pouvoir être servi

    La fiche officielle documente des intégrations avec Transformers, vLLM, SGLang et TokenSpeed. NVIDIA annonce de son côté une prise en charge fonctionnelle de jour zéro dans SGLang, vLLM et TensorRT-LLM, ainsi que des recettes de post-entraînement NeMo. Pour un agent, cette compatibilité est une donnée concrète : elle conditionne le passage d’un modèle publié à un système que l’on peut intégrer.

    Qwen distingue ce modèle expérimental de Qwen3.8-Flash, proposé comme service officiel via QwenCloud. Les noms proches correspondent donc à deux voies d’accès : des poids à intégrer et à servir d’un côté, un service géré de l’autre.

    Des résultats à lire avec leur protocole

    Qwen publie des résultats sur des tâches de code, d’agents et de raisonnement. La fiche accompagne plusieurs tableaux de précisions méthodologiques, notamment les harnais employés pour certains tests et des cellules sans score disponible. Ces éléments permettent de situer les mesures ; ils ne les transforment pas en évaluation indépendante.

    NVIDIA publie également des mesures de déploiement sur GB300 NVL72. Elles renseignent une plate-forme matérielle et logicielle précise, non le coût ou le débit de toute installation. La portée durable de Qwen3.8-Flash-Next est donc ailleurs : les poids ouverts permettent désormais de vérifier, sur d’autres tâches et d’autres machines, si cette architecture allège effectivement la contrainte du long contexte pour des agents réels.

    Sources

    LAISSER UN COMMENTAIRE

    S'il vous plaît entrez votre commentaire!
    S'il vous plaît entrez votre nom ici