Tencent a publié Hy4 preview, un modèle de langage à experts multiples dont les poids sont disponibles sous licence Apache 2.0. Le point à retenir n’est pas seulement son total de 770 milliards de paramètres : le modèle n’en active que 49 milliards par token, annonce une fenêtre de contexte d’un million de tokens et arrive avec une version FP8. Pour les équipes qui construisent des assistants de code ou d’analyse, c’est un nouveau candidat ouvert à évaluer — pas encore une preuve qu’il surclasse les autres dans tous les usages.
La présentation de Tencent insiste sur le travail productif : développement logiciel, analyse de documents, jeux et recherche. Mais le nom preview compte. La fiche du modèle reconnaît des difficultés connues : sur les tâches complexes, Hy4 peut raisonner plus longtemps que nécessaire et avoir tendance à sur-vérifier son propre travail.
770 milliards au total, 49 milliards actifs : ce que décrit l’architecture
Hy4 preview est un modèle Mixture-of-Experts (MoE). Sa fiche technique indique 770 milliards de paramètres au total, dont 49 milliards activés par token. Elle décrit 78 couches, 256 experts routés et un expert partagé ; pour chaque token, huit experts routés et l’expert partagé sont activés.
Cette distinction évite une comparaison trop rapide avec un modèle dense : « 770 milliards » ne décrit pas, à lui seul, le calcul mobilisé pour chaque token. Le chiffre de 49 milliards actifs renseigne précisément sur cette partie du mécanisme. Tencent annonce aussi une longueur de contexte de 1 million de tokens. C’est une capacité déclarée du modèle ; elle ne permet pas, à elle seule, de conclure au coût ou à la qualité d’un usage réel sur un très long dossier.
Des poids ouverts, mais une mise en œuvre qui reste technique
Le dépôt Hugging Face de Tencent place Hy4 preview sous licence Apache 2.0 et met à disposition les poids Hy4 preview ainsi qu’une variante Hy4 preview-FP8. La documentation propose des voies de déploiement via vLLM ou SGLang.
L’ouverture des poids change donc l’accès au modèle, mais ne transforme pas automatiquement Hy4 en outil léger à installer sur n’importe quelle machine. Les documents publiés décrivent des voies de déploiement et de quantification ; ils ne fournissent pas ici de mesure générale du matériel nécessaire, du coût final d’exploitation ou de la qualité obtenue dans chaque environnement.
Le test contre GLM-5.3 et Kimi K3 : un signal, pas un classement général
Tencent rapporte une évaluation à l’aveugle réalisée en interne : 163 experts ont jugé 203 tâches d’ingénierie. Hy4 preview y obtient une moyenne de 2,99 sur 4, contre 2,92 pour GLM-5.3 et 2,94 pour Kimi K3.
Ces chiffres éclairent le positionnement revendiqué pour des tâches d’ingénierie, mais leur périmètre est étroit : le test a été conçu et exécuté par Tencent. Ils ne valent pas une comparaison indépendante de tous les benchmarks, de toutes les langues ou de toutes les charges agentiques. C’est précisément le type de résultat à confronter à des évaluations externes avant de choisir un modèle pour une production.
Pourquoi le « preview » est plus important que le slogan
Tencent affirme avoir entraîné Hy4 pour la planification, le débogage et la validation de tâches logicielles de longue durée, ainsi que pour l’analyse de données et la création de documents. L’entreprise dit aussi que le modèle a participé à des expériences d’optimisation liées à l’entraînement, aux données, aux évaluations et à l’inférence. Ces éléments décrivent les travaux et résultats annoncés par Tencent, non une validation indépendante de son autonomie.
La fiche publiée par l’équipe Hy précise au contraire qu’il s’agit d’une version précoce. Elle mentionne notamment un raisonnement parfois trop long et une propension à trop vérifier. Pour un agent, ces limites ont une conséquence très concrète : davantage de raisonnement peut peser sur la durée et la prévisibilité d’une tâche. L’annonce apporte ainsi un modèle ouvert de très grande taille à la course aux agents, mais elle laisse ouverte la question décisive : dans quels flux de travail Hy4 sera-t-il réellement fiable et économique ?


