Ce qu’il faut retenir :
- Le modèle Hy4-preview aurait été ramené de 1 500 à environ 200 gigaoctets, soit 87 % de réduction.
- La perte de performance annoncée s’établit à 2 %, sans validation indépendante à ce stade.
- L’outil de compression AngelSlim est publié en source ouverte par Tencent.
Une publication communautaire affirme que le modèle Hy4-preview de Tencent a été comprimé de 1,5 téraoctet à environ 200 gigaoctets, en conservant 98 % de ses performances. La réduction atteindrait 87 % de la taille du fichier pour une perte annoncée de deux points. Un chiffre qui mérite d’être examiné avant d’être célébré.
Ce que contient Hy4-preview
Le modèle en question constitue le vaisseau amiral des poids ouverts de Tencent, avec 770 milliards de paramètres au total et 49 milliards activés par token, soit 6,4 % de l’ensemble. Sa fenêtre de contexte atteint un million de tokens.
Son architecture repose sur un mélange d’experts, avec 256 experts routés par couche sur 77 couches, la première étant dense. Ce principe consiste à n’activer qu’une fraction du réseau pour chaque token, plutôt que l’intégralité des paramètres.
Le coût d’exploitation en découle. Servir la variante en précision réduite exige normalement un nœud de huit processeurs graphiques, les recettes officielles de déploiement visant un parallélisme de tenseurs de huit.
Comment cette compression a été obtenue
L’opération repose sur AngelSlim, la boîte à outils de compression développée par Tencent et publiée en source ouverte. Le résultat prend la forme d’un fichier au format GGUF, celui qui alimente depuis des années l’inférence locale via llama.cpp.
Le niveau de quantification atteint revient à environ deux bits par poids en moyenne, un degré d’agressivité rarement praticable sans dégradation notable.
Pourquoi ce modèle encaisse aussi bien la compression
Deux explications techniques circulent, et elles se tiennent.
La première tient à l’état d’entraînement du modèle. Tencent présente explicitement cette version comme une préversion, avec de la marge restante en pré-entraînement comme en post-entraînement. Un modèle poussé à ses limites a des poids ajustés au plus juste, et réduire leur précision détruit ce réglage fin. Un modèle sous-entraîné conserve de la redondance, ce qui laisse à l’erreur de quantification moins de prise.
La seconde tient à l’architecture. Le mécanisme de routage qui décide quels experts s’activent pour un token donné se révèle robuste au bruit introduit par la compression. Cette observation recoupe un constat répandu chez les praticiens : la quantification agressive fonctionne bien sur les très grands modèles et mal sur les petits, la masse de paramètres jouant un rôle de correction d’erreur naturelle.
Le chiffre de 98 % demande vérification
C’est le point sur lequel la prudence s’impose. Les résultats publiés par Tencent portent sur le modèle en précision complète, pas sur la version comprimée.
Ces scores restent solides : 92,3 sur GPQA Diamond, 85,4 sur Terminal-Bench 2.1, 82,9 % sur SWE-bench Multilingual, 55,4 sur Humanity’s Last Exam avec outils. Rien n’établit toutefois que la version à 200 gigaoctets s’en approche à deux points près.
Le risque d’optimisation pour les bancs d’essai fait partie du débat public dans ce secteur, et la communauté technique l’a soulevé immédiatement.
Un retour d’expérience sur la génération précédente donne un ordre de grandeur plus concret. Un testeur de la compression appliquée à Hy3 décrivait des sorties légèrement moins bonnes mais toujours utilisables, sans erreur de syntaxe, avec une capacité d’anticipation réduite. Transposé à Hy4-preview, ce fameux écart de 2 % pourrait recouvrir précisément cela : des chaînes de raisonnement plus courtes et une planification moins fine, sur des réponses qui restent valides.
Un élément reste en revanche vérifiable par n’importe qui : la taille du fichier. Un modèle de 200 gigaoctets qui s’exécute et produit des sorties cohérentes constitue un résultat mesurable. Le débat ne porte pas sur sa taille, mais sur sa qualité.
Ce que cela change pour l’IA locale
Le saut se mesure en catégorie de matériel. On passe d’une grappe de huit processeurs graphiques à une station de travail haut de gamme.
La comparaison avec l’annonce d’Apple et EXO Labs la semaine dernière éclaire cette trajectoire : quatre Mac Studio reliés en Thunderbolt 5 offrent un téraoctet de mémoire unifiée à 4,8 téraoctets par seconde, pour environ 43 800 dollars. Un modèle de 200 gigaoctets y tiendrait sans difficulté.
Une réserve technique persiste. Décharger le modèle sur un disque NVMe reste possible, mais ce support est plusieurs ordres de grandeur plus lent que la mémoire vive, ce qui effondre le débit de génération.
La pression sur les prix
L’écart tarifaire constitue l’argument le plus tangible de cette annonce. Hy4-preview est facturé 0,834 dollar par million de tokens en entrée et 2,501 dollars en sortie, contre 4 et 20 dollars pour GPT-5.6 Sol en configuration de base, et jusqu’à 8 et 30 dollars sur les contextes étendus.
Sur la sortie, poste le plus lourd des charges de travail agentiques, le rapport atteint huit fois moins cher, et jusqu’à douze fois sur les grands contextes.
L’auto-hébergement ajoute une seconde marche. Faire tourner un modèle chez soi supprime entièrement la facturation au token, ce qui change l’équation pour les entreprises qui ont commencé à arbitrer vers les options les moins coûteuses, comme le montrent les données de dépenses publiées la semaine dernière sur les modèles américains de pointe.
Et maintenant ?
Le champ des poids ouverts s’est densifié cette année, avec Qwen3-Coder-Next, Kimi K2 de Moonshot, MiniMax-M2, Devstral 2 de Mistral et l’expérience Gpt-Oss d’OpenAI. Hy4-preview y entre avec le plus grand nombre de paramètres.
La particularité de Tencent tient moins au modèle qu’à l’ensemble. L’entreprise publie à la fois le modèle et l’outil qui permet de le réduire, en source ouverte, ce qui rend la démarche reproductible par des tiers.
Deux points à surveiller. La publication de mesures indépendantes sur la version comprimée, seul élément capable de valider ou d’invalider le chiffre de 98 %. Et la suite des travaux de recherche du groupe, qui explore avec WeDLM-8B une architecture de diffusion abandonnant la génération autorégressive, signe que l’effort porte autant sur les fondations que sur l’optimisation.
Cet article vous a plu ? Recevez les prochains par email
Rejoignez +40 000 abonnés. L'essentiel du marché crypto dans votre boîte mail, tous les 2 jours.