Grok 4.6 est sorti ce 12 août 2026, chez xAI, avec une fenêtre de 500 000 tokens et une grille agressive : 2 $ le million de tokens en entrée, 6 $ en sortie. Les tableaux de benchmarks tournent déjà, et la lecture qu'on en fait partout est fausse dans les deux sens. Grok 4.6 n'est pas « le meilleur modèle » : sur le code et sur l'indice global, Fable 5 reste devant. Mais il vient de prendre la première place là où l'IA fait le travail d'un cadre — valeur économique, traitement de dossiers, et surtout juridique, où il creuse +40 % en relatif. Quant au prix, il ne veut rien dire tant qu'on ne sait pas comment on s'en sert : au-delà de 200 000 tokens, xAI double le tarif — et l'applique à TOUS les tokens de la requête, pas seulement à ceux qui dépassent. Voici les chiffres, le calcul que personne ne fait, et ce qu'on ferait à votre place.
À retenir
- ▸Grok 4.6 est sorti le 12 août 2026 (xAI) : fenêtre de 500 000 tokens, disponible via l'API xAI, Cursor, OpenRouter, Vercel et Cloudflare.
- ▸Prix : 2 $ le million de tokens en entrée, 6 $ en sortie, 0,50 $ pour l'entrée mise en cache. C'est 2,5 fois moins cher que Kimi K3 sur la sortie (15 $) — l'écart le plus net de toute la grille.
- ▸Le piège : au-delà de 200 000 tokens, le tarif passe à 4 $ / 12 $ — et s'applique à l'intégralité de la requête, pas au seul dépassement. Une requête de 201 000 tokens coûte donc deux fois une requête de 199 000 tokens. Kimi K3, lui, reste au même prix sur toute sa fenêtre d'un million.
- ▸« Moins cher » s'inverse sur l'entrée mise en cache : 0,50 $ chez Grok contre 0,30 $ chez Kimi K3, qui tape le cache plus de neuf fois sur dix en charge de code. Aux prix publiés, l'équilibre se fait à 45 tokens d'entrée cachée pour 1 token de sortie : en dessous Grok est moins cher, au-dessus c'est Kimi.
- ▸Grok 4.6 ne gagne que trois tests sur dix : GDPVal-AA v2 (1753), AA-Briefcase (1577) et Harvey LAB (15,8 %). Deux de ces victoires sont dans le bruit — +0,7 % sur GDPVal, +0,2 % sur Briefcase, face à Fable 5.
- ▸Le seul écart réel est juridique : 15,8 % contre 11,3 % pour Fable 5 sur Harvey LAB, soit +40 % en relatif. Sur tout ce qui est code (CursorBench, FrontierCode, APEX-SWE, APEX-Agents) et sur l'indice global, Fable 5 reste devant ; sur le terminal et DeepSWE, c'est GPT-5.6 qui domine.
- ▸Le vrai bond est interne : face à Grok 4.5, la version 4.6 gagne 5 points d'indice, +227 points sur GDPVal et +264 sur AA-Briefcase. xAI ne rattrape pas la frontière du code — il devient sérieux sur le travail de bureau.
Dans cet article
1. Ce que xAI a livré
Grok 4.6 est disponible depuis le 12 août 2026. Pas d'annonce à tiroirs : le modèle est en ligne, servi par l'API xAI, et déjà branché chez les intermédiaires qui comptent pour une équipe technique — Cursor, OpenRouter, Vercel et Cloudflare. Autrement dit, l'essayer ne demande pas un contrat : cela demande de changer un identifiant de modèle dans une variable d'environnement, à condition que votre chaîne ait été construite pour ça.
La fenêtre de contexte monte à 500 000 tokens. C'est la moitié du million qu'affichent Kimi K3 et quelques autres, mais c'est très au-delà de ce qu'une PME consomme réellement dans 95 % de ses usages : un cahier des charges, un an de comptes rendus, un dossier d'appel d'offres complet tiennent tous très en dessous. Retenez surtout ce chiffre-là — 500 000 — parce qu'il ne dit pas ce qu'il semble dire : la grille tarifaire, elle, change de régime bien avant, à 200 000 tokens.
Grok 4.6 — fiche
| Éditeur | xAI |
| Sortie | 12 août 2026 |
| Contexte | 500 000 tokens |
| Prix API | 2 $ / M tokens en entrée · 6 $ / M en sortie · 0,50 $ / M en entrée mise en cache |
| Au-delà de 200 000 tokens | 4 $ / M en entrée · 12 $ / M en sortie, appliqués à toute la requête |
| Disponibilité | API xAI, Cursor, OpenRouter, Vercel, Cloudflare |
Source : grille tarifaire et fiche Grok 4.6, relevées le 12/08/2026.
2. Le prix, et le palier à 200 000 tokens
Voici la grille, mise face à celle de Kimi K3, dont nous avions disséqué le passage au prix du frontier — c'est le comparable le plus utile, parce que les deux visent le même poste de dépense : les chaînes agentiques longues.
| Par million de tokens | Entrée | Entrée en cache | Sortie |
|---|---|---|---|
| Grok 4.6 · requête ≤ 200 000 tokens | 2 $ | 0,50 $ | 6 $ |
| Grok 4.6 · requête > 200 000 tokens | 4 $ | — | 12 $ |
| Kimi K3 · prix plat jusqu'à 1 000 000 de tokens | 3 $ | 0,30 $ | 15 $ |
Grilles publiées, relevées le 12/08/2026. Le tarif majoré de Grok 4.6 s'applique à l'intégralité des tokens d'une requête qui franchit le seuil.
Un. Sur la sortie, l'écart est massif et il est en faveur de Grok. 6 $ contre 15 $, soit 2,5 fois moins cher. Ce n'est pas un détail comptable : dans une chaîne agentique, la sortie est le poste qui dérape, parce que chaque étape produit un raisonnement, un plan, un appel d'outil, puis un compte rendu. C'est la ligne de facture qu'on ne voit pas venir.
Deux. Sur l'entrée non mise en cache, Grok est aussi devant — 2 $ contre 3 $. Jusqu'ici, tout le monde écrira la même chose : Grok 4.6 est moins cher. C'est vrai, et c'est incomplet.
Trois. Sur l'entrée mise en cache, l'ordre s'inverse. 0,50 $ chez Grok, 0,30 $ chez Kimi K3 — soit une remise de 90 % sur son tarif plein. Et ce n'est pas un cas d'école : sur des charges de code, le taux de cache dépasse 90 %, ce qui veut dire qu'en pratique l'entrée s'y facture 0,30 $, pas 3 $. Sur le poste « entrée », Grok 4.6 devient donc 1,7 fois plus cher que le modèle qu'il est censé sous-coter.
Le piège que personne ne relèvera.
Au-delà de 200 000 tokens, xAI ne facture pas le dépassement au tarif majoré : il refacture toute la requête à 4 $ / 12 $. Faites le calcul sur deux requêtes voisines, avec 2 000 tokens de sortie chacune. À 199 000 tokens d'entrée : 0,398 $ + 0,012 $ = 0,41 $. À 201 000 tokens d'entrée : 0,804 $ + 0,024 $ = 0,83 $. Un pour cent de contexte en plus, et la facture double. Kimi K3, lui, reste au même tarif jusqu'à un million de tokens : il n'a pas de palier du tout.
Ce seuil n'est pas une curiosité de tarification. C'est une contrainte d'architecture, et elle se traite dans le code, pas dans le choix du modèle : si votre client d'API n'impose pas de plafond dur sous les 200 000 tokens, il suffit d'une conversation qui s'allonge, d'un PDF plus gros que prévu ou d'un historique qu'on a oublié de tronquer pour que le coût unitaire de la requête double sans qu'aucune alerte ne se déclenche. Rien ne casse. Rien ne le signale. La facture arrive à la fin du mois.
3. Le calcul que personne ne fait
« Moins cher » n'est pas une propriété du modèle : c'est une propriété de votre usage. Deux modèles dont l'un gagne sur l'entrée et l'autre sur la sortie basculent l'un devant l'autre à un ratio précis — et ce ratio se calcule, à partir des grilles publiées, en une ligne. Appelons R le nombre de tokens d'entrée consommés pour chaque token de sortie produit. C'est la seule métrique qui compte ici, et elle se lit directement dans les journaux de votre API.
| Régime | Point de bascule | Qui gagne |
|---|---|---|
| Entrée non cachée, requête ≤ 200 000 tokens | aucun | Grok 4.6, toujours |
| Entrée cachée, requête ≤ 200 000 tokens | R = 45 | Grok si R < 45, Kimi K3 au-delà |
| Requête > 200 000 tokens | R = 3 (entrée pleine) · R = 0,8 (entrée cachée) | Kimi K3, en pratique toujours |
Calcul JAIKIN à partir des grilles publiées le 12/08/2026 : on égalise le coût des deux modèles et on résout en R (tokens d'entrée par token de sortie).
Sous le seuil, avec une entrée mise en cache, la bascule se fait à R = 45. Le détail du calcul, pour que vous puissiez le refaire avec vos propres tarifs négociés : Grok coûte 0,50 R + 6, Kimi coûte 0,30 R + 15 (par million de tokens de sortie) ; les deux s'égalisent quand 0,20 R = 9, soit R = 45. En clair : si votre chaîne relit moins de 45 tokens d'entrée déjà vus pour chaque token qu'elle produit, Grok 4.6 est moins cher. Au-delà, c'est Kimi. Un agent de code qui relit 30 000 tokens de contexte pour émettre un correctif de 400 tokens tourne à R = 75. Il est du mauvais côté de la bascule.
Au-dessus du seuil, l'affaire est pliée. Grok passe à 4 $ / 12 $ quand Kimi K3 reste à 3 $ / 15 $ — et à 0,30 $ dès que l'entrée est en cache. Face au tarif plein de Kimi, Grok ne reste devant que si la requête écrit plus d'un token pour trois tokens lus : sur 200 000 tokens d'entrée, cela ferait déjà plus de 66 000 tokens de sortie. Face à son tarif caché, il faudrait 1,23 token écrit par token lu, soit près de 247 000 tokens de sortie pour 200 000 lus. Aucun de ces deux régimes n'existe. Dès qu'on travaille en long contexte — un dépôt de code entier, un corpus documentaire, une base de connaissances complète —, l'avantage de prix de Grok 4.6 ne se réduit pas : il change de camp.
Ce n'est pas une raison de renoncer à Grok 4.6, c'est une raison de savoir à quoi on l'affecte. Sur une chaîne de tri d'e-mails comme celles que nous exploitons — l'une d'elles traite 13 000 e-mails par mois —, R est bas : on donne un message court à lire et on produit une classification, un résumé, une réponse. C'est exactement le profil où les 6 $ de sortie de Grok 4.6 font la différence, et où le palier des 200 000 tokens ne sera jamais atteint.
4. Les benchmarks : trois victoires, dont deux dans le bruit
Voici le tableau complet, avec les concurrents qui comptent. Nous le publions en entier, y compris les lignes que Grok perd — c'est ce qui distingue une analyse d'un communiqué.
| Test | Grok 4.6 High | Grok 4.5 High | GPT-5.6 Sol Max | Fable 5 Max |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 (Elo) | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69,9 % | 66,7 % | 67,2 % | 70,5 % |
| DeepSWE v1.1 | 65,9 % | 54 % | 73 % | 70 % |
| FrontierCode v1.1 | 61,3 % | 56,6 % | 60,6 % | 64,9 % |
| APEX-Agents | 57,5 % | 47,1 % | 56,7 % | 59,2 % |
| Terminal-Bench v3.0 | 26 % | 15,7 % | 34,6 % | 34,1 % |
| APEX-SWE | 56,4 % | 53,6 % | — | 58,8 % |
| AA-Briefcase (Elo) | 1577 | 1313 | 1502 | 1574 |
| Harvey LAB (Vals, juridique) | 15,8 % | 12,9 % | 2,5 % | 11,3 % |
Tableau Artificial Analysis, relevé le 12/08/2026 ; pour les modèles tiers, le meilleur score entre l'auto-déclaré et le public. Lignes surlignées : les trois tests que Grok 4.6 remporte.
Grok 4.6 gagne trois lignes sur dix. GDPVal-AA v2 (la valeur économique du travail produit), AA-Briefcase (le traitement de dossiers) et Harvey LAB (le juridique). C'est tout. Et il faut oser regarder les marges : 1753 contre 1741 sur GDPVal, c'est +0,7 %. 1577 contre 1574 sur Briefcase, c'est +0,2 %. Sur un classement Elo, deux victoires à cette distance ne sont pas des victoires : ce sont des égalités qu'un rejeu du benchmark pourrait retourner. Quiconque titre « Grok 4.6 dépasse Fable 5 » en s'appuyant dessus vend du clic.
Le seul écart réel est juridique. Harvey LAB : 15,8 % contre 11,3 % pour Fable 5, soit +40 % en relatif — et 2,5 % seulement pour GPT-5.6 Sol, qui s'effondre sur cette épreuve. C'est là que l'annonce a du sens, et c'est aussi là qu'il faut garder la tête froide : 15,8 %, en valeur absolue, reste un score bas. Le juridique assisté par IA n'est pas résolu ; il est simplement moins mauvais chez xAI ce mois-ci. Pour une PME, l'usage réaliste n'est pas « l'IA rédige mes contrats », c'est « l'IA prépare la lecture d'un contrat, et un humain tranche » — un cadrage qui a d'autant plus d'importance que l'obligation de transparence de l'AI Act (article 50) est applicable depuis le 2 août 2026 : vos interlocuteurs doivent savoir quand ils parlent à une machine.
Sur le code, Fable 5 n'a pas bougé. CursorBench (70,5 contre 69,9), FrontierCode (64,9 contre 61,3), APEX-SWE (58,8 contre 56,4), APEX-Agents (59,2 contre 57,5) : quatre lignes, quatre fois Fable 5 devant — et l'indice global lui donne 62 contre 61. Sur le terminal et sur DeepSWE, ce n'est même pas Fable qui domine, mais GPT-5.6 Sol (34,6 % et 73 %), Grok 4.6 restant loin derrière sur Terminal-Bench, à 26 %. Si votre sujet est de faire écrire, corriger et exécuter du code par une machine, Grok 4.6 n'est aujourd'hui le bon choix sur aucune de ces épreuves.
Le vrai bond est ailleurs : il est interne. Face à Grok 4.5, la version 4.6 prend 5 points d'indice global, +227 points sur GDPVal, +264 sur AA-Briefcase, et double presque son score sur Terminal-Bench (26 % contre 15,7 %). C'est un progrès considérable — d'une génération à l'autre, chez le même éditeur. Il se trouve simplement que la marche à monter pour rejoindre Fable 5 sur le code était plus haute que celle-là.
Notre position.
Grok 4.6 est meilleur là où l'IA fait le travail d'un cadre — synthétiser un dossier, produire un livrable, préparer une lecture juridique. Fable 5 reste devant là où elle fait le travail d'un développeur. Ce n'est pas un classement, c'est une répartition des rôles : les deux tiennent dans la même chaîne, et rien n'oblige à choisir un camp — sauf d'avoir câblé le nom du modèle en dur quelque part.
5. Ce qu'on ferait à votre place
Un. Mesurer R avant de discuter du prix. Sortez de vos journaux d'API le rapport entre tokens d'entrée et tokens de sortie sur vos trois traitements les plus coûteux. C'est une requête, pas un projet. Sans ce chiffre, toute comparaison de grilles est un pari : nous venons de montrer que la réponse s'inverse à R = 45, et personne ne connaît son R de tête.
Deux. Poser un plafond dur à 200 000 tokens dans le client d'API, avec troncature ou résumé en amont, et une alerte quand une requête s'en approche. Ce n'est pas de l'optimisation : c'est le seul garde-fou entre vous et une facture qui double sans prévenir. La règle est valable même si vous restez sur un autre modèle demain — les paliers de ce type se multiplient chez tous les éditeurs.
Trois. Router par tâche, pas par fournisseur. Dossiers, notes de synthèse, préparation juridique : Grok 4.6 mérite le test. Code, refactoring, agents qui exécutent : restez sur Fable 5, et regardez GPT-5.6 sur les tâches de terminal. Le débat « quel est le meilleur modèle » n'a jamais produit un euro de marge chez nos clients ; le routage par tâche, si.
Quatre — et c'est le seul point qui vous protège vraiment : rendre le modèle remplaçable. Un modèle sorti aujourd'hui sera dépassé dans six semaines, changera de prix, ou deviendra indisponible pour une raison qui n'a rien à voir avec vous. Une chaîne où le fournisseur est écrit en dur s'arrête ce jour-là ; une chaîne où le modèle est un paramètre, doublé d'un repli, continue de tourner. C'est le principe de réversibilité que nous imposons dans les projets d'automatisation IA que nous livrons, et c'est ce qui transforme la sortie de Grok 4.6 en après-midi de mesure plutôt qu'en migration.
Si vous n'avez pas ces quatre points, le vrai sujet n'est pas Grok 4.6. C'est que votre coût à l'usage n'est pas piloté — et ça, c'est une conversation d'une demi-heure avec un consultant IA qui a déjà vu ce poste de dépense doubler chez d'autres, pas un choix de modèle.
6. FAQ
Qu'est-ce que Grok 4.6 ?
Grok 4.6 est le modèle d'IA de xAI sorti le 12 août 2026, doté d'une fenêtre de contexte de 500 000 tokens. Il est accessible via l'API xAI et distribué par Cursor, OpenRouter, Vercel et Cloudflare. Sa grille est de 2 $ le million de tokens en entrée et 6 $ en sortie, avec un tarif majoré à 4 $ / 12 $ au-delà de 200 000 tokens par requête.
Combien coûte Grok 4.6 ?
2 $ le million de tokens en entrée, 6 $ en sortie, et 0,50 $ le million pour l'entrée mise en cache. Au-delà de 200 000 tokens dans une même requête, le tarif passe à 4 $ en entrée et 12 $ en sortie — et ce tarif majoré s'applique à l'intégralité des tokens de la requête, pas seulement à la part qui dépasse le seuil.
Quel est le piège des 200 000 tokens chez Grok 4.6 ?
Le doublement du tarif ne s'applique pas au seul dépassement, mais à toute la requête. Une requête de 199 000 tokens d'entrée et 2 000 tokens de sortie coûte 0,41 $ ; la même à 201 000 tokens d'entrée coûte 0,83 $. Un pour cent de contexte supplémentaire double donc la facture. La parade est un plafond dur posé côté client, sous les 200 000 tokens, avec troncature ou résumé en amont.
Grok 4.6 est-il meilleur que Fable 5 ?
Non, pas globalement. Sur les dix tests relevés, Grok 4.6 n'en remporte que trois : GDPVal-AA v2 (1753 contre 1741), AA-Briefcase (1577 contre 1574) et Harvey LAB (15,8 % contre 11,3 %). Les deux premières marges, respectivement +0,7 % et +0,2 %, sont dans le bruit de mesure. Le seul écart significatif est le juridique, à +40 % en relatif. Sur l'indice global (62 contre 61) et sur tout le code — CursorBench, FrontierCode, APEX-SWE, APEX-Agents —, Fable 5 reste devant.
Grok 4.6 est-il moins cher que Kimi K3 ?
Cela dépend du ratio entre tokens d'entrée et tokens de sortie de votre usage. Sur la sortie, Grok 4.6 est 2,5 fois moins cher (6 $ contre 15 $) ; sur l'entrée non mise en cache, il est aussi devant (2 $ contre 3 $). Mais sur l'entrée mise en cache, Kimi K3 passe devant (0,30 $ contre 0,50 $), et l'équilibre se situe à 45 tokens d'entrée cachée par token de sortie. Au-delà de 200 000 tokens par requête, Grok double son tarif quand Kimi K3 reste plat : l'avantage change alors de camp.
Faut-il basculer sur Grok 4.6 ?
Pas en bloc. Testez-le sur les tâches de type dossier, synthèse et préparation juridique, où il est le mieux placé, et gardez Fable 5 sur le code. La vraie question n'est pas de choisir un fournisseur mais de pouvoir en changer : si le nom du modèle est un paramètre de configuration doublé d'un modèle de repli, essayer Grok 4.6 coûte une après-midi de mesure. S'il est écrit en dur dans vos traitements, aucun classement de benchmarks ne vous sera utile.
Sources
- « Grok 4.6 : price, benchmarks, API, Cursor, context window » (12/08/2026) : prix 2 $ / 6 $, 0,50 $ en entrée cachée, palier à 200 000 tokens facturé sur toute la requête (4 $ / 12 $), contexte 500 000 tokens, disponibilité API xAI, Cursor, OpenRouter, Vercel, Cloudflare
- Grille tarifaire Kimi K3 (relevée le 12/08/2026) : 3 $ en entrée sans cache, 0,30 $ en cache hit, 15 $ en sortie, prix plat sur la fenêtre d'un million de tokens
- Tarifs API Moonshot (relevés le 12/08/2026) : taux de cache supérieur à 90 % sur les charges de code, remise de 90 % sur l'entrée cachée
- Tableau de benchmarks Artificial Analysis, relevé le 12/08/2026 : AA Intelligence Index, GDPVal-AA v2, CursorBench v3.2, DeepSWE v1.1, FrontierCode v1.1, APEX-Agents, Terminal-Bench v3.0, APEX-SWE, AA-Briefcase, Harvey LAB (Vals). Pour les modèles tiers, le meilleur score entre l'auto-déclaré et le public
- Règlement européen sur l'IA (AI Act), article 50 — obligation de transparence applicable depuis le 2 août 2026
Les points de bascule (R = 45, R = 3, R = 0,8) sont des calculs JAIKIN à partir des grilles publiées ci-dessus, et non des chiffres d'éditeur. Les positions exprimées dans cet article sont des opinions de JAIKIN, signalées comme telles.
Les modèles changent tous les mois. Votre coût à l'usage, lui, n'est pas piloté ?
Sans engagement. Réponse d'un expert sous 24 h.
Réserver un diagnostic IA gratuit (30 min)