Skip to main content

GLM-5.3 : premier des poids ouverts sur le code, sans prix à l'usage

Sorti le 14 août 2026 : six fois mieux que GLM-5.2 sur Terminal-Bench 3.0, sur le même modèle de base de 743 milliards de paramètres. Mais GLM-5.3 n'a aucune grille au million de tokens — seulement des forfaits à 18, 80 et 168 $, dont les heures pleines tombent entre 8h et 12h, heure de Paris.

Note Google 5/5 · +130 projets livrés en cumulé · réservez 30 min

Tendance
Par Victor
7 min de lecture

GLM-5.3 est sorti ce 14 août 2026 chez Z.ai : 4,6 → 28,3 sur Terminal-Bench 3.0, six fois mieux que GLM-5.2 en un mois, sur le même modèle de base de 743 milliards de paramètres. Il devient le meilleur modèle de code à poids ouverts. Mais si vous cherchez son prix au million de tokens, vous ne le trouverez pas : au lancement, GLM-5.3 n'a aucune grille à l'usage. Les chiffres officiels, le calcul d'heure de pointe que personne ne fait, et ce qu'on ferait à votre place.

À retenir

  • Même modèle de base que GLM-5.2 (743 milliards de paramètres) : l'éditeur écrit que tous les gains viennent du seul post-entraînement.
  • Aucun prix au million de tokens. GLM-5.3 ne figure pas dans la grille API de Z.ai ; il n'existe qu'au forfait, à 18 $, 80 $ et 168 $ par mois. GLM-5.2 reste à 1,40 $ / 4,40 $.
  • Heures pleines : 14h–18h UTC+8, soit 8h–12h à Paris. Hors de cette fenêtre, un appel ne coûte que la moitié des points. Votre matinée de travail est l'heure pleine de Pékin.
  • Premier des poids ouverts, deuxième ligne du classement général : 28,3 sur Terminal-Bench 3.0 contre 17,4 pour Kimi K3, mais 33,7 pour Fable 5 et 34,6 pour GPT-5.6 Sol. Il gagne trois tests : CyberGym, AutomationBench et GDPval-AA v2.
  • 2 436 vulnérabilités trouvées dans 269 projets open source, dont 1 097 critiques ou élevées. Durée de vie moyenne avant découverte : 26,6 ans. La plus ancienne datait de 1981.
  • Poids ouverts deux semaines après le lancement, après évaluation de sûreté. C'est ce jour-là que le modèle devient chiffrable à l'usage — pas avant.

1. Ce que Z.ai a livré

La phrase d'ouverture de la note technique de Z.ai mérite d'être lue deux fois : « tout ce que nous avons fait pour GLM-5.3, c'est passer le post-entraînement à l'échelle ». Le modèle de base n'a pas bougé. Pour une direction technique, c'est l'information la plus utile du communiqué : un modèle peut désormais être multiplié par six en quatre semaines sans qu'un seul poids du socle change. Toute décision d'architecture qui suppose un modèle stable un an est caduque.

Un détail bloquant : GLM-5.3 ne sait plus fonctionner sans raisonnement. Le paramètre thinking.type: "disabled" n'est plus supporté, remplacé par trois niveaux d'effort (low, high, max). Une chaîne qui coupait le raisonnement pour tenir la latence ne se dégrade pas : elle échoue.

GLM-5.3 — fiche

ÉditeurZ.ai (Zhipu AI)
Sortie14 août 2026
Modèle de base743 milliards de paramètres — identique à GLM-5.2
RaisonnementObligatoire ; low, high, max (défaut)
Prix à l'usageAucun au lancement — absent de la grille API
AccèsGLM Coding Plan, ZCode ; utilisable depuis Claude Code et OpenCode
Poids ouvertsDeux semaines après le lancement, après évaluation de sûreté

Sources : note technique GLM-5.3 et grille tarifaire Z.ai, relevées le 14/08/2026.

2. Le prix : un forfait, pas une grille

Nous avons relevé la grille API officielle le jour de la sortie : GLM-5.3 n'y figure pas. On y trouve GLM-5.2 à 1,40 $ / 4,40 $ le million de tokens, GLM-5 à 1 $ / 3,20 $, GLM-4.7 à 0,60 $ / 2,20 $ — toute la gamme, sauf le modèle du jour. Restent les forfaits, dont l'éditeur exprime l'usage en multiples du palier d'entrée :

Forfait mensuel Lite Pro Max
Prix affiché18 $80 $168 $
Promotion de lancement12,60 $56 $117,60 $
Usageréférence6 × Lite14 × Lite
Coût par unité d'usage18 $13,33 $12 $

Source : page d'abonnement Z.ai, relevée le 14/08/2026. Deux offres à sièges existent aussi, à 88 $ et 188 $ par siège et par mois.

Le palier le plus cher est le moins cher à l'unité, à −33 % par rapport à Lite : le prix est multiplié par 9,3 entre Lite et Max, l'usage par 14.

Conséquence opérationnelle nette : vous ne pouvez pas calculer un coût par dossier traité. Chez nos clients, la question n'est jamais « combien coûte le modèle » mais « combien coûte un devis produit ». Un quota plafonne, il ne se divise pas. GLM-5.3 est donc excellent pour travailler, et inadapté à une chaîne facturée à l'unité comme celles que nous livrons en développement de logiciel sur mesure. Chez Grok 4.6, le piège était dans la grille ; ici, il n'y a pas de grille.

3. Votre matinée coûte double

Le Coding Plan passe à un système de points, comptés séparément sur l'entrée, l'entrée en cache et la sortie. Une clause change tout : hors heures de pointe, un appel ne consomme que 50 % des points. Les heures de pointe sont définies en UTC+8, de 14h à 18h, du lundi au vendredi. La plupart des lecteurs européens rangeront l'information au rayon « sans objet », en se disant que l'heure pleine chinoise tombe la nuit chez nous. C'est l'inverse :

Fuseau Heures pleines (100 % des points) Heures creuses (50 %)
UTC+8 (référence éditeur)14h – 18h, du lundi au vendreditout le reste, week-ends compris
Paris, heure d'été8h – 12h, du lundi au vendredimidi – 8h le lendemain, week-ends compris
Paris, heure d'hiver7h – 11h, du lundi au vendredi11h – 7h le lendemain, week-ends compris

Conversions calculées par JAIKIN depuis la plage UTC+8 publiée dans la note technique Z.ai.

Un traitement lancé à 9h30 consomme deux fois plus de points que le même à 14h30. Déplacer les tâches non interactives — rapports, revue de code, indexation, tests — de la matinée vers l'après-midi double le quota effectif sans changer un centime au forfait. Poussé au bout : un Lite à 18 $ utilisé hors pointe revient à 9 $ l'unité d'usage, moins cher qu'un Max en heures pleines à 12 $. Le choix de l'heure pèse plus que le choix du palier.

Réserve honnête : l'éditeur publie la règle des 50 % et la plage horaire, pas le barème détaillé des points par modèle. Le rapport de deux est solide, le coût absolu d'une tâche ne l'est pas tant que vous ne l'avez pas mesuré sur une semaine.

4. Les benchmarks officiels

Graphique officiel Z.ai comparant GLM-5.3, GLM-5.2, Kimi K3, Fable 5 et GPT-5.6 Sol sur six benchmarks : Terminal Bench 3.0, DeepSWE, Agents' Last Exam, AutomationBench, HLE avec outils et GDPVal-AA v2
Cliquer pour agrandir. GLM-5.3 face à GLM-5.2, Kimi K3, Fable 5 et GPT-5.6 Sol sur six benchmarks. Illustration officielle — source : Z.ai, note technique GLM-5.3 (14/08/2026).

Trois victoires sur les dix lignes relevées, toutes du côté de l'exécution : CyberGym (84,5), AutomationBench (48,2) et GDPval-AA v2 (1769), ce dernier mesurant la valeur économique du travail produit. Sur le code pur, GLM-5.3 reste à la deuxième ligne. Le bon comparatif n'est donc pas la frontière fermée, mais les autres poids ouverts : 28,3 contre 17,4 pour Kimi K3.

Graphique officiel Z.ai : précision en fonction du nombre de tokens de sortie par tâche, pour GLM-5.3, GLM-5.2, Claude Fable 5 et Claude Opus 4.8, à trois niveaux d'effort
Cliquer pour agrandir. Précision rapportée aux tokens consommés, sur le banc interne Z.ai Code Bench. Illustration officielle — source : Z.ai, note technique GLM-5.3 (14/08/2026).

Ce second graphe est le plus utile pour une facture. À effort maximal, GLM-5.3 atteint 34,5 % en consommant environ 75 000 tokens de sortie par tâche, contre 96 000 pour GLM-5.2 qui plafonnait à 23,4 %. À effort élevé, il fait 31,4 % en 50 000 tokens là où Claude Opus 4.8 fait 29,5 % en 120 000. Mieux et moins cher en même temps : c'est rare, la plupart des gains annoncés ces derniers mois se payaient en tokens de raisonnement. Claude Fable 5 reste devant, à 39,5 %.

5. Le volet cyber

Graphique officiel Z.ai sur trois bancs de cybersécurité : CyberGym, ExploitBench et ExploitGym, comparant GLM-5.3 à GLM-5.2, Kimi K3, Mythos 5 et GPT-5.6 Sol
Cliquer pour agrandir. Découverte et exploitation de vulnérabilités sur trois bancs. Illustration officielle — source : Z.ai, note technique GLM-5.3 (14/08/2026). L'éditeur nomme ici « Mythos 5 » la colonne à laquelle son propre tableau de résultats attribue les mêmes valeurs (83,8 / 78,0 / 181–247) sous le nom « Fable 5 ».

Z.ai décrit cette capacité comme plus rapide que prévu : le modèle n'isole plus des défauts, il enchaîne les étapes d'une exploitation complète. Sur du code réel, après revue humaine : 2 436 vulnérabilités dans 269 projets open source, dont 1 097 critiques ou élevées — noyaux système, moteurs de navigateur, protocoles réseau. Durée de vie moyenne avant découverte : 26,6 ans ; la plus ancienne remontait à 1981. 53 sont divulguées, 2 383 sous embargo dans un registre public.

Ces projets sont les dépendances de votre ERP, de votre site, de votre logiciel de gestion. Ces failles n'avaient pas été vues parce que les chercher coûtait un temps d'expert que personne ne finançait : ce coût vient de s'effondrer, et les poids seront publics dans deux semaines. L'attaquant n'a besoin d'aucune validation pour lancer un scan ; le défenseur doit d'abord savoir ce qu'il héberge.

D'où la seule question qui compte : savez-vous quelles bibliothèques tournent dans vos applications, et depuis quand ? Si la réponse est non, l'inventaire des dépendances passe devant tout le reste — c'est le premier point que nous relevons dans un audit IA d'entreprise, et il ne demande aucune IA pour commencer.

6. Ce qu'on ferait à votre place

Un. Ne pas migrer une chaîne de production cette semaine. Sans prix à l'usage, pas de coût par dossier, donc pas d'arbitrage défendable. Attendez les poids, fin août : c'est ce jour-là que le modèle devient chiffrable et hébergeable ailleurs que chez l'éditeur, comme nous l'avons détaillé pour GLM-5.2 sur un cloud européen.

Deux. Le mettre entre les mains des développeurs dès maintenant. C'est là que le forfait est au bon endroit : un poste, un abonnement, un coût fixe. À 18 $, le test coûte moins qu'une réunion pour en débattre. Le critère n'est pas le classement, c'est le nombre de tickets terminés sans reprise sur deux semaines.

Trois. Déplacer les traitements par lots à l'après-midi, et vérifier vos appels au raisonnement désactivé avant toute bascule. La première ligne vous fait économiser sans changer de modèle ; la seconde évite de transformer une migration d'après-midi en incident de production.

Quatre — le seul point qui vous protège vraiment : rendre le modèle remplaçable. GLM-5.3 est la deuxième sortie majeure en deux semaines après Grok 4.6 ; la suivante arrive. Une chaîne où le fournisseur est écrit en dur devra être reprise à chaque fois ; une chaîne où le modèle est un paramètre, doublé d'un repli, absorbe la sortie du jour en changeant une variable. C'est le principe de réversibilité que nous imposons dans les projets d'automatisation IA que nous livrons.

Si ces quatre points ne sont pas en place, le vrai sujet n'est pas GLM-5.3 : c'est que votre chaîne dépend d'un fournisseur que vous ne pouvez pas changer. C'est une conversation d'une demi-heure avec un consultant IA qui a déjà démêlé ce type de dépendance, pas un choix de modèle.

7. FAQ et sources

Qu'est-ce que GLM-5.3 ?

Le modèle d'IA de Z.ai (Zhipu AI) sorti le 14 août 2026, orienté code et tâches agentiques longues. Il repose sur le même modèle de base de 743 milliards de paramètres que GLM-5.2 : tous les gains viennent du post-entraînement. Accessible via l'abonnement GLM Coding Plan et l'agent ZCode ; ses poids doivent être publiés deux semaines après le lancement.

Combien coûte GLM-5.3 ?

Au 14 août 2026, il n'a pas de prix au million de tokens : il ne figure pas dans la grille API de Z.ai. Il n'existe qu'au forfait : 18 $ (Lite), 80 $ (Pro) et 168 $ (Max) par mois, avec 30 % de remise en promotion de lancement, plus deux offres à sièges à 88 $ et 188 $. À titre de comparaison, GLM-5.2 reste facturé 1,40 $ le million en entrée et 4,40 $ en sortie.

Quelles sont les heures de pointe du GLM Coding Plan ?

De 14h à 18h en UTC+8, du lundi au vendredi, soit 8h à 12h heure de Paris en été et 7h à 11h en hiver. En dehors, week-ends compris, les appels ne consomment que 50 % des points. Pour une équipe française, la matinée de travail est donc la fenêtre la plus coûteuse, et décaler les traitements automatisés à l'après-midi double le quota effectif.

GLM-5.3 est-il meilleur que Fable 5 ou GPT-5.6 ?

Non, pas sur le code : 28,3 sur Terminal-Bench 3.0 contre 33,7 pour Fable 5 et 34,6 pour GPT-5.6 Sol ; 78,1 contre 88,2 sur FrontierSWE. Il passe devant sur trois tests : CyberGym (84,5), AutomationBench (48,2) et GDPval-AA v2 (1769). Face aux autres modèles à poids ouverts, il prend la première place : 28,3 contre 17,4 pour Kimi K3.

Faut-il basculer sur GLM-5.3 ?

Pour un poste de développeur, oui : le test vaut ses 18 $. Pour une chaîne de production facturée à l'usage, non : sans grille au million de tokens, aucun coût par dossier n'est calculable, et un quota plafonne au lieu de se diviser. Attendez la publication des poids. Vérifiez au passage que vos appels n'utilisent pas thinking.type: "disabled", supprimé dans cette version : la requête échoue au lieu de se dégrader.

Sources

Deux sorties majeures en deux semaines. Votre chaîne est-elle conçue pour en absorber une troisième ?

Sans engagement. Réponse d'un expert sous 24 h.

Réserver un diagnostic IA gratuit (30 min)
Victor Gless-Krumhorn

Victor Gless-Krumhorn

Fondateur & Consultant IA — JAIKIN

Expert en implémentation IA et automatisation pour PME et ETI. Accompagne des entreprises en France, en Allemagne et en Suisse, de la cartographie des processus à la mise en production.

1 à 3 tâches automatisables identifiées — diagnostic gratuit

30 minutes avec un expert, un plan d'action écrit sous 24 h.

Devis sous 24 h