Publicités

    Top 5

    Articles similaires

    Google DiffusionGemma : le modèle de Google qui réécrit le texte par blocs parallèles

    Google DeepMind a publié le 10 juin 2026 DiffusionGemma, un modèle ouvert de 26 milliards de paramètres qui ne génère plus le texte « un mot après l’autre » mais en parallèle, par blocs entiers. Présenté comme une expérimentation Apache 2.0, il promet jusqu’à quatre fois la vitesse des Gemma 4 autorégressifs sur un seul GPU haut de gamme, et peut tenir dans 18 Go de VRAM une fois quantifié. Pour les chercheurs, développeurs et intégrateurs français, ce n’est pas une annonce comme les autres : la diffusion textuelle, longtemps cantonnée à la recherche, passe en produit industriel.

    Trois chiffres à retenir

    • 26 milliards de paramètres au total, mais 3,8 milliards actifs par inférence (Mixture of Experts).
    • Jusqu’à 1 000+ tokens/s sur un seul NVIDIA H100, 700+ tokens/s sur une GeForce RTX 5090, ~2 000 tokens/s sur DGX Station.
    • Génération parallèle de 256 tokens par passe avant, avec attention bidirectionnelle sur tout le bloc.
    Publicités

    Pourquoi la diffusion change la donne pour le texte

    La quasi-totalité des modèles de langage — Gemini, Claude, GPT — reposent sur une architecture autorégressive. Le modèle prédit chaque token en se servant uniquement de ce qui le précède, comme une machine à écrire mécanique. En cloud, à très fort QPS, cette contrainte est invisible : on mutualise des milliers de requêtes et on sature le GPU.

    Mais dès qu’on ramène l’inférence en local sur un poste de développeur, l’autorégression devient un goulot d’étranglement : le GPU passe la majorité de son temps à attendre le « prochain caractère ». La diffusion, popularisée pour l’image par Stable Diffusion et Imagen, inverse le problème : on part d’une grille de tokens placeholder, puis on débruite ce bloc entier en plusieurs passes jusqu’à convergence. L’attention est bidirectionnelle — chaque token voit les autres.

    Pour Google, ce changement de paradigme déplace le goulot d’étranglement de la bande passante mémoire vers le calcul, ce qui est favorable aux GPU modernes et à leurs Tensor Cores. Le bénéfice est maximal à faible ou moyen batch sur un seul accélérateur — exactement le régime d’un assistant local ou d’un IDE augmentée.

    Architecture : ce que fait le 26B / 3,8B

    DiffusionGemma hérite de la famille Gemma 4 et de la recherche Gemini Diffusion conduite chez DeepMind. Comme détaillé dans la couverture d’Ars Technica, il s’agit d’une architecture Mixture of Experts : 26 milliards de paramètres au total, mais seulement 3,8 milliards activés à l’inférence. Cette particularité explique l’empreinte mémoire modérée et la compatibilité matérielle grand public.

    Le modèle applique ensuite un mécanisme inédit dans la gamme : à chaque passe avant, il génère un bloc pouvant aller jusqu’à 256 tokens en parallèle, puis itère pour affiner. La conséquence, listée par Google et ses partenaires, est que les tâches non linéaires — édition en ligne, code infilling, séquences d’aminoacides, graphes mathématiques, résolution de Sudoku — deviennent nettement plus naturelles, parce que le modèle peut relire l’ensemble du bloc et se corriger en continu au lieu de devoir « deviner » ce qu’il écrira ensuite.

    Caractéristique Gemma 4 autorégressif DiffusionGemma
    Paradigme Token par token (gauche à droite) Bloc parallèle débruité (jusqu’à 256 tokens / passe)
    Attention Unidirectionnelle (causale) Bidirectionnelle
    Latence sur 1× H100 ~250 tokens/s (ordre de grandeur comparable) 1 000+ tokens/s
    Latence sur 1× RTX 5090 ~175 tokens/s 700+ tokens/s
    Empreinte VRAM quantifiée ≥ 24 Go (selon variante) ~18 Go
    Cas d’usage optimal Production cloud, génération longue structurée Édition inline, code, agents locaux
    Qualité de sortie globale Plus élevée (recommandé en production) Légèrement inférieure (Google le reconnaît)

    Comparaison indicative des profils. Les ordres de grandeur Gemma 4 sont cités à titre de repère, les valeurs exactes publiées variant selon la variante et le quantizer utilisé.

    Publicités

    Ce que cela change pour les développeurs et les chercheurs

    Le choix d’Apache 2.0 n’est pas anodin. Les poids sont disponibles sur Hugging Face sous l’organisation Google (variante diffusiongemma-26B-A4B-it) et l’écosystème d’intégration a été préparé en parallèle : vLLM (avec une intégration Red Hat), MLX côté Apple Silicon, Hugging Face Transformers, NVIDIA NIM, NVIDIA NeMo, Unsloth pour le fine-tuning, Hackable Diffusion en JAX. Un support natif dans llama.cpp est annoncé comme imminent.

    Concrètement, cela rend crédibles plusieurs classes d’usage que l’autorégression rendait pénibles :

    • Édition inline : réécriture ciblée d’un paragraphe sans tout régénérer depuis le début.
    • Code infilling : remplissage précis d’un trou dans une fonction, où chaque token dépend potentiellement d’un futur token.
    • Séquences biologiques : acides aminés, où la structure non linéaire rend la causalité pénalisante.
    • Maths et graphes : représentations où la correction en bloc est un avantage net.
    • Agents locaux à faible latence : workflows interactifs où quelques centaines de millisecondes de gain changent la sensation produit.

    Google et NVIDIA ont par exemple publié une démo où DiffusionGemma, après fine-tuning par Unsloth, résout des grilles de Sudoku — un exercice notoirement difficile pour les modèles autorégressifs parce que chaque token dépend de tokens futurs.

    Ce que cela ne remplace pas

    Google reste lucide : « la qualité de sortie globale de DiffusionGemma est inférieure à Gemma 4 standard. Pour les applications qui exigent une qualité maximale, nous recommandons de déployer Gemma 4 standard ». Le gain de vitesse se paie en constance sur de longues générations, et l’architecture est surtout pertinente sur des charges à faible ou moyen batch sur un accélérateur unique.

    En production cloud à fort QPS, où l’autorégression mutualise efficacement des milliers de requêtes, le décodage parallèle peut au contraire augmenter le coût de service. Ce n’est donc pas un remplaçant de Gemini : c’est un complément explorant un axe différent du compromis vitesse-qualité, plus proche du poste de travail que du数据中心 hyperscale.

    Pourquoi cette sortie compte pour l’écosystème IA

    La diffusion textuelle n’est pas nouvelle : des laboratoires comme Inception (modèle Mercury), ByteDance ou Ant Group (LLaDA, Seed Diffusion) ont publié des résultats sur ce paradigme ces derniers mois. Mais la donne change quand un acteur du calibre de Google DeepMind met à disposition un modèle 26B/3,8B Apache 2.0, déjà câblé dans vLLM, MLX, NIM, Transformers et, à terme, llama.cpp.

    Pour la communauté open source francophone, cela ouvre une voie concrète vers des assistants locaux rapides, des outils de complétion de code temps réel et des pipelines d’analyse documentaire qui tournent sur une RTX 4090 ou 5090 sans dépendance au cloud — un axe stratégique de souveraineté d’inférence alors que plusieurs fournisseurs américains restreignent actuellement la diffusion de leurs modèles pour des raisons de sécurité nationale.

    Reste l’inconnue majeure : la qualité sur des benchmarks standardisés face aux modèles à diffusion concurrents, et l’adoption réelle dans des produits utilisateurs finaux. Sur ces deux points, la sortie est trop récente pour que la communauté ait consolidé une lecture indépendante. DiffusionGemma reste à ce jour ce qu’il est dès l’annonce : un coup d’envoi industriel — pas un verdict.

    Sources

    LAISSER UN COMMENTAIRE

    S'il vous plaît entrez votre commentaire!
    S'il vous plaît entrez votre nom ici