Anthropic vient de publier Claude Opus 5.5, premier modèle de la famille Claude 5.5. La promesse tient en une phrase : le niveau de Fable 5.1 sur la plupart des tâches, pour environ 40 % moins cher qu’Opus 5. Et côté atelier, le détail qui compte pour nous : Claude Code en fait le modèle par défaut dès la version 2.1.280. Voici le tableau officiel, le prix réel (surtout les lectures de cache), les ruptures API, et ce que 40 % sur AutomationBench veut encore dire quand on livre du logiciel pour des PME.
En bref — Claude Opus 5.5, sorti le 22 septembre 2026, est facturé 4 $ / 20 $ par million de tokens (contre 5 $ / 25 $ pour Opus 5). Les lectures de cache tombent à 0,20 $ (contre 0,50 $). Sur le tableau officiel : 66,4 % sur Terminal-Bench 4.0, 57,8 % sur CursorBench 4.0, 1 846 en Elo GDPval-AA v2.1, 40,0 % sur AutomationBench. Identifiant API : claude-opus-5-5. Effort par défaut : medium. Sources : annonce Anthropic et documentation Claude Platform, relevées le jour J.
Dans cet article
Les benchmarks officiels de Claude Opus 5.5
Relevé le 22/09/2026 sur l’annonce Anthropic. Sauf mention contraire, Opus 5.5 tourne en thinking adaptatif à effort maximal. Terminal-Bench 4.0 : effort xhigh pour Opus 5.5 (meilleur score publié). Les garde-fous de production étaient actifs : sur cyber, un refus bascule vers Opus 4.8 ; sur biologie / frontier LLM, vers Opus 5 — ce qui abaisse probablement les scores Opus 5.5 sur ces zones.
Codage agentique — Terminal-Bench 4.0
66,4 %
Fable 5.1 : 55,8 % · Opus 5 : 52,3 % · GPT-6 Astra : 57,9 % · GPT-5.6 Sol : 37,3 %
Codage agentique — FrontierCode v1.1 (Main)
54,4 %
Fable 5.1 : 50,3 % · Opus 5 : 48,0 % · GPT-6 Astra : 53,3 % · GPT-5.6 Sol : 47,5 %
Codage agentique — CursorBench 4.0
57,8 %
Fable 5.1 : 51,8 % · Opus 5 : 46,6 % · GPT-5.6 Sol : 41,7 % (Astra non renseigné)
Travail de connaissance — GDPval-AA v2.1 (Elo)
1 846
Fable 5.1 : 1 735 · Opus 5 : 1 708 · GPT-6 Astra : 1 542 · GPT-5.6 Sol : 1 588
Workflows métier — AutomationBench (Zapier)
40,0 %
Fable 5.1 : 31,4 % · Opus 5 : 26,9 % · GPT-6 Astra : 41,4 % · GPT-5.6 Sol : 28,8 %
Raisonnement — Humanity’s Last Exam (avec outils)
67,7 %
Fable 5.1 : 65,6 % · Opus 5 : 63,6 % · GPT-5.6 Sol : 57,2 %
Recherche scientifique agentique — Terminal-Bench-Science 0.1
58,7 %
Fable 5.1 : 52,6 % · Opus 5 : 29,0 % · GPT-6 Astra : 64,6 % · GPT-5.6 Sol : 22,4 %
Usage de l’ordinateur — OSWorld 2.0 (partial)
81,8 %
Fable 5.1 : 80,7 % · Opus 5 : 74,0 %
Lecture de graphiques — Chartography (avec outils)
89,0 %
Fable 5.1 : 88,4 % · Opus 5 : 83,4 %
Source : Anthropic, « Introducing Claude Opus 5.5 », 22/09/2026. AutomationBench : évaluations Zapier (early access pour Opus 5.5 ; leaderboard public pour les autres). Les écarts-types publiés sur Terminal-Bench 4.0 sont de l’ordre de ±2,6 pts pour Opus 5.5.
Lecture honnête du tableau
Opus 5.5 gagne la majorité des lignes agentiques. Il ne gagne pas partout : GPT-6 Astra reste devant sur AutomationBench et Terminal-Bench-Science. Et Anthropic prévient explicitement que les marges de benchmark deviennent un guide moins fiable à ce niveau — l’écart ressenti avec Fable 5.1 serait plus étroit que le tableau. C’est rare qu’un éditeur écrase son propre storytelling : on le prend au sérieux.
Prix : 4 $ / 20 $, et surtout 0,20 $ en cache read
La grille officielle, relevée sur l’annonce et la page Pricing Claude Platform :
- Entrée
- 4 $ / MTok (Opus 5 : 5 $)
- Sortie
- 20 $ / MTok (Opus 5 : 25 $)
- Cache read
- 0,20 $ / MTok (Opus 5 : 0,50 $)
- Cache write
- 5 $ / MTok (Opus 5 : 6,25 $)
- Mode rapide (Fast)
- 8 $ / 40 $ · jusqu’à ~2,5× · Claude Code + Claude Platform
Anthropic chiffre environ −40 % de coût sur les charges typiques à réglages par défaut, en cumulant tarif plus bas et moins de tokens par tâche. La sortie est annoncée plus de 30 % plus rapide qu’Opus 5. Les plafonds d’usage sur 5 heures augmentent sur Pro, Max et Team ; un reset de rate limit stockable est ajouté pour les abonnés.
Fiche technique utile pour brancher un agent :
- Identifiant :
claude-opus-5-5(Bedrock :anthropic.claude-opus-5-5) - Contexte : 1 M tokens · sortie max : 128 K (Batch jusqu’à 300 K)
- Thinking : adaptatif, toujours actif · effort par défaut : medium
- Coupure des connaissances : juin 2026
Ce que ça change dans Claude Code
Ce n’est pas un détail de changelog. Pour une agence qui livre avec Claude Code tous les jours — site, CRM, portails clients — le modèle par défaut est l’outil.
- Défaut : l’alias
opusrésout vers Opus 5.5 sur l’API Anthropic, Max, Team Premium et Enterprise à l’usage. - Version minimale : Claude Code v2.1.280 ou plus. En dessous :
claude update. - Effort : Opus 5.5 démarre à medium. Un ancien réglage global d’effort ne s’applique pas automatiquement à ce modèle — il faut le fixer par modèle.
- Thinking : impossible à couper (comme sur Fable). Le curseur d’effort remplace le vieux « disable thinking ».
- Garde-fous biologie / cyber : Opus 5.5 est déployé avec des filets proches de Fable 5.1. En Claude Code, un refus cyber peut retomber sur Opus 4.8 ; un refus biologie sur Opus 5. Sur des codebases sensibles, anticiper ces bascules.
Anthropic publie aussi des retours early access chiffrés côté coding : migration de ~680 000 lignes en moins d’une journée ; audit/fix d’une base de ~200 000 lignes en moins de 3 h (contre > 20 h et 2,5× plus de tokens pour Opus 5) ; traduction HAProxy C→Rust en 9,5 h contre 12 h pour Fable 5.1, pour 51 % moins cher, les deux passant presque tous les tests de non-régression HAProxy. Ce sont des anecdotes d’éditeur — utiles comme ordre de grandeur, pas comme SLA.
Ce qu’on fera concrètement chez JAIKIN
Passer l’alias opus dès la 2.1.280, garder Fable 5.1 en réserve pour les sessions où l’effort medium d’Opus 5.5 ne tient pas la spec, et réécrire les consignes de travail plutôt que de coller l’ancien prompt Opus 5. On a déjà payé cette leçon en juillet : un modèle plus autonome casse les automatismes taillés pour le précédent.
AutomationBench à 40 % : mieux, pas « résolu »
En juillet, sur Opus 5, on avait insisté sur la ligne que personne ne commentait : 26 % sur les workflows métier. Aujourd’hui Opus 5.5 monte à 40,0 % (mesure Zapier, sans modèles de repli — donc plus sévère que la réalité avec fallback). Fable 5.1 est à 31,4 %, Opus 5 à 26,9 %. GPT-6 Astra reste un cran devant à 41,4 %.
Deux lectures, les deux vraies :
La bonne. +13 points depuis Opus 5 sur l’épreuve qui ressemble le plus à un processus d’entreprise. Pour une automatisation IA, le choix du modèle cesse d’être neutre.
La mauvaise, plus importante. 40 %, c’est encore six tâches sur dix en échec quand on coupe les filets. Le meilleur modèle du tableau n’automatise pas votre entreprise tout seul. La valeur reste dans la spécification, les données, les garde-fous et la reprise sur erreur — exactement le métier d’une agence IA qui livre en production, pas un pilote de démo.
Ruptures API : ce qui casse si vous migrez d’Opus 5
Documentation Claude Platform — quatre changements qui cassent du code existant :
- Thinking non désactivable —
thinking: {"type": "disabled"}ou un budget manuel renvoie une 400. Utiliseradaptive+output_config.effort. - Forced tool use — renvoie une erreur.
- Thinking blocks liés au modèle et à la conversation (comme Fable 5.1).
- Ancien computer use
computer_20251124refusé sur l’API Claude et Google Cloud.
Effet collatéral : le texte entre appels d’outils revient dans des blocs thinking vides au réglage d’affichage par défaut. Une UI qui streamait ces messages comme barre de progression devient silencieuse tant qu’on n’ajuste pas le display.
Ce que Claude Opus 5.5 change pour une PME
Trois conséquences, sans extrapolation.
1. Le coût d’un agent de coding devient défendable au quotidien. Moins cher à l’étiquette, beaucoup moins cher en cache, plus rapide : la boucle « spécifier → générer → relire → corriger » baisse de prix. Utile pour un logiciel sur mesure où le volume de tokens est le poste invisible.
2. Migrer n’est pas un remplacement à chaud. Ruptures API + nouveau défaut d’effort + thinking toujours on. Rejouer vos tests métier avant de basculer les workflows critiques.
3. Le modèle ne mange toujours pas les 60 % restants. AutomationBench à 40 % rappelle la frontière. Un agent en production se juge sur la reprise d’erreur et la traçabilité (AI Act, article 50), pas sur un Elo.
FAQ — Claude Opus 5.5 et Claude Code
Combien coûte Claude Opus 5.5 ?
Opus 5.5 est-il le défaut dans Claude Code ?
Faut-il abandonner Fable 5.1 ?
Que valent les 40 % d’AutomationBench ?
Comment migrer depuis Opus 5 sans casser la prod ?
Sources
- Anthropic — « Introducing Claude Opus 5.5 », 22/09/2026 (anthropic.com/claude-opus-5-5) : benchmarks, prix, early access coding, sûreté.
- Claude Platform Docs — Claude Opus 5.5 overview, What’s new, Pricing, Models overview (platform.claude.com), relevés le 22/09/2026.
- Claude Code Docs — Model configuration : défaut Opus 5.5, v2.1.280+, effort medium, fallbacks biologie/cyber (code.claude.com).
- AutomationBench : résultats Zapier cités dans l’annonce Anthropic (early access Opus 5.5 ; leaderboard public pour Opus 5 / GPT-5.6 Sol / GPT-6 Astra).
- System Card Claude Opus 5.5 — anthropic.com/claude-opus-5-5-system-card.
