
Quoi de neuf avec Claude Opus 4.7 : benchmarks, /ultrareview et la couche de sécurité Mythos (avril 2026)
Claude Opus 4.7 est sorti le 16 avril 2026 avec SWE-bench Verified à 87,6 %, SWE-bench Pro à 64,3 %, et un tarif inchangé à 5 $ en entrée / 25 $ en sortie par million de tokens. Trois nouveautés vont changer votre semaine : xhigh est désormais le niveau d'effort par défaut dans Claude Code, /ultrareview est une toute nouvelle commande slash pour la revue de code multi-étapes, et Mythos Preview — le modèle frère annoncé le 7 avril — est la raison pour laquelle Opus 4.7 est le premier Claude livré avec la nouvelle couche de sécurité post-Mythos d'Anthropic. Voici le récapitulatif complet, les chiffres et la checklist de migration.
Résumé rapide — Ce qui sort aujourd'hui
- Publication : Disponible en général le 16 avril 2026 (Claude.ai, API, Claude Code, Amazon Bedrock, Google Cloud Vertex AI, Microsoft Foundry)
- Tarif : Inchangé — 5 $ par million de tokens en entrée, 25 $ par million de tokens en sortie
- SWE-bench Pro : 64,3 % (contre 53,4 % sur Opus 4.6) — devant GPT-5.4 Pro (57,7 %) et Gemini 3.1 Pro (54,2 %)
- SWE-bench Verified : 87,6 % (contre 80,8 %)
- CursorBench : 70 % (contre 58 %)
- Nouveau : niveau d'effort
xhigh— désormais le défaut de Claude Code sur tous les plans - Nouveau : commande slash
/ultrareview— revue de code multi-étapes qui s'exécute en arrière-plan - Bêta publique : Budgets de tâches — plafonner la dépense en dollars sur des tâches agentiques longues
- Mythos Preview est le modèle frère à accès limité qui a motivé les nouvelles mesures de sécurité de la version 4.7
- Prérequis Claude Code : v2.1.111 ou ultérieure — exécutez
claude update - Bascule par défaut : Les API Enterprise et pay-as-you-go basculent de la version 4.6 à la version 4.7 le 23 avril 2026
Quoi de neuf avec Claude Opus 4.7 ?
Claude Opus 4.7 a été lancé le 16 avril 2026 avec un nouveau niveau d'effort xhigh (le nouveau défaut de Claude Code), la commande slash /ultrareview pour les revues de code multi-étapes, une fonctionnalité de budgets de tâches en bêta publique et un tokeniseur mis à jour. SWE-bench Pro passe à 64,3 % ; le tarif reste à 5 $ / 25 $ par million de tokens.
Voici chaque changement qui compte, en un seul tableau :
| Fonctionnalité | Ce qu'elle fait | Où elle est disponible |
|---|---|---|
Niveau d'effort xhigh | Nouveau palier entre high et max ; budget de réflexion adaptatif | API + Claude Code (défaut) |
/ultrareview | Revue de code multi-étapes (sécurité, style, logique, tests) en arrière-plan | Claude Code 2.1.111+ |
| Budgets de tâches (bêta) | Plafonner la dépense en tokens sur un agent longue durée | API + Claude Code |
| Mode auto étendu | Le modèle s'auto-alloue l'effort de réflexion | Utilisateurs du tier Max |
| Résolution vision | Plafond d'entrée relevé à 2 576 px (~3,75 MP, 3× l'ancien) | API + Claude.ai |
| Tokeniseur mis à jour | Produit 1,0 à 1,35× plus de tokens selon le contenu | Tous les endpoints |
| Mémoire inter-sessions | Basée sur le système de fichiers ; mémorise les conventions du projet | Claude Code |
| Respect des instructions | Interprétation littérale plus stricte des prompts | Tous les endpoints |
Les trois que vous ressentirez en premier sont xhigh, /ultrareview et les budgets de tâches. Anthropic a fait de xhigh le défaut dans Claude Code parce que leurs évaluations internes ont montré que c'est le bon équilibre qualité/latence pour le coding agentique — pas parce que c'est le plus gros marteau. /ultrareview est une toute nouvelle commande slash qui exécute des passes de revue séparées avec un contexte dédié pour chaque étape, de sorte que votre passe « avons-nous raté une vérification de null ? » n'est pas en concurrence de contexte avec votre passe « est-ce conforme à notre config lint ? ». Les budgets de tâches en bêta publique vous permettent de dire : exécute cet agent de migration et arrête-toi quand tu as brûlé 10 $ de tokens Opus 4.7.
Deux changements plus subtils peuvent vous mordre. Premièrement, le tokeniseur mis à jour produit 1,0 à 1,35× plus de tokens pour le même contenu, ce qui signifie que le même prompt qui vous coûtait 2,50 $ sur la version 4.6 pourrait vous coûter jusqu'à 3,38 $ sur la version 4.7. Deuxièmement, le respect des instructions d'Opus 4.7 est nettement plus strict — les prompts qui misaient sur l'interprétation souple de « à peu près » ou « en gros » par la version 4.6 obtiendront des sorties plus littérales. Anthropic signale les deux dans les notes de version officielles. Prévoyez en conséquence et auditez votre bibliothèque de prompts avant la bascule du 23 avril.
Benchmarks — Opus 4.7 vs 4.6 vs 4.5 (et GPT-5.4 et Gemini 3.1 Pro)
Claude Opus 4.7 obtient 87,6 % sur SWE-bench Verified (contre 80,8 %), 64,3 % sur SWE-bench Pro (contre 53,4 %) et 70 % sur CursorBench (contre 58 %). Il devance GPT-5.4 Pro (57,7 %) et Gemini 3.1 Pro (54,2 %) sur SWE-bench Pro, et aligne les scores GPQA Diamond à un point près des deux concurrents.
Décortiquons ces chiffres — parce qu'un bond de 6,8 points sur SWE-bench Verified paraît aride jusqu'à ce qu'on se souvienne qu'il représente de vraies pull requests que la version 4.6 ne pouvait pas clore proprement.
| Benchmark | Opus 4.5 | Opus 4.6 | Opus 4.7 | GPT-5.4 Pro | Gemini 3.1 Pro |
|---|---|---|---|---|---|
| SWE-bench Verified | — | 80,8 % | 87,6 % | — | — |
| SWE-bench Pro | — | 53,4 % | 64,3 % | 57,7 % | 54,2 % |
| GPQA Diamond | — | — | 94,2 % | 94,4 % | 94,3 % |
| CursorBench | — | 58 % | 70 % | — | — |
| Acuité visuelle (XBOW) | — | 54,5 % | 98,5 % | — | — |
"SWE-bench Pro : Claude Opus 4.7 vs concurrents"
Tableau de données
| "Modèle" | "SWE-bench Pro" |
|---|---|
| "Opus 4.6" | 53.4 |
| "GPT-5.4 Pro" | 57.7 |
| "Gemini 3.1 Pro" | 54.2 |
| "Opus 4.7" | 64.3 |
Coding. SWE-bench Pro est la manchette — un bond de 10,9 points sur la version 4.6 et une avance de 6,6 points sur GPT-5.4 Pro. Sur Rakuten-SWE-Bench, Anthropic rapporte 3× plus de tâches de production résolues. CodeRabbit affiche +10 points de pourcentage de rappel. Un benchmark interne sur 93 tâches a résolu 13 % de tâches supplémentaires, dont 4 qu'Opus 4.6 et Opus Sonnet 4.6 ne parvenaient pas à résoudre. Si vous avez lu notre comparatif Claude Code vs Cursor vs Copilot, vous savez déjà que CursorBench est un test d'éditions pratiques dans des codebases réels — passer de 58 % à 70 % là est sans doute plus utile que les chiffres SWE-bench.
Raisonnement. GPQA Diamond à 94,2 % se trouve statistiquement à égalité avec GPT-5.4 Pro (94,4 %) et Gemini 3.1 Pro (94,3 %). C'est une frontière à trois voies en ce moment.
Vision. XBOW est passé de 54,5 % à 98,5 % — pratiquement une saturation. Le plafond d'entrée d'image est désormais de 2 576 px sur le côté long, soit environ 3,75 mégapixels, plus de 3× les modèles Claude précédents.
Agent financier. Nouvel état de l'art (référence : 60,7 % de la version 4.6).
Mise en garde honnête. Anthropic eux-mêmes signalent des inquiétudes concernant BrowseComp dans les notes de version — vous ne devriez pas prendre un seul benchmark comme évangile, et nous non plus.
Tester Opus 4.7 High (Mode de réflexion étendue)
Le mode de réflexion étendue de Claude Opus 4.7 laisse le modèle décider de la quantité à raisonner avant de répondre. Il est livré avec quatre niveaux d'effort : medium, high, xhigh (nouveau) et max. xhigh est désormais le défaut dans Claude Code — il bat high sur les tâches de débogage difficiles avec environ 30 à 50 % de tokens de réflexion supplémentaires et 2× la latence de high, mais coûte bien moins que max.
Pensez aux niveaux d'effort comme à un moteur d'échecs fonctionnant à la profondeur 12 versus la profondeur 20. Plus de profondeur = de meilleurs coups, mais des horloges bien plus longues. Avec les versions 4.5 et 4.6, vous choisissiez un budget de tokens à l'avance. Avec la version 4.7, le modèle s'auto-alloue dans le palier d'effort que vous avez choisi — c'est le vrai changement.
| Effort | Idéal pour | Latence (relative) | Impact coût en tokens | Delta qualité vs high |
|---|---|---|---|---|
medium | Chat interactif, corrections rapides | 1× | Référence | — |
high | Tâches de coding standard | ~1,5× | +10-20 % | +3-5 pp sur SWE-bench |
xhigh (nouveau défaut) | Coding agentique, tâches longue portée | ~2,5× | +25-40 % | +5-8 pp sur SWE-bench |
max | Débogage le plus difficile, R&D | 4-6× | +50-80 % | +1-2 pp sur xhigh |
Honnêtement, que xhigh soit le défaut est la manchette ici. Boris Cherny (Anthropic) l'a confirmé sur Threads : les données d'évaluation internes ont montré que xhigh est le bon équilibre qualité/latence pour le coding agentique — c'est pourquoi Claude Code ne vous demande plus. Dans nos tests, xhigh a systématiquement terminé un refactoring multi-fichiers en un seul passage là où high avait besoin de deux itérations. max a apporté des gains marginaux sur un bug de concurrence épineux mais a à peu près triplé le temps d'attente. Votre kilométrage variera, mais c'est ce que nous avons observé.
Le paramétrer via l'API est une seule ligne :
from anthropic import Anthropic
client = Anthropic()
message = client.messages.create(
model="claude-opus-4-7",
max_tokens=4096,
thinking={"type": "enabled", "budget_tokens": 16000}, # équivalent xhigh
messages=[{"role": "user", "content": "Refactor this function..."}]
)Dans Claude Code, fixez-le avec claude --model opus --effort xhigh ou exportez ANTHROPIC_EFFORT=xhigh. Si vous avez besoin de la référence complète, consultez comment configurer quel modèle Claude Code utilise et la documentation officielle de configuration des modèles Claude Code.
Un piège à signaler : un effort plus élevé = plus de tokens de réflexion = coût cumulé, et le tokeniseur mis à jour de la version 4.7 gonfle déjà les comptages de tokens de 1,0 à 1,35×. Si vous êtes sensible aux coûts, associez xhigh à des stratégies agressives de mise en cache des prompts — nous y reviendrons en détail — et prévoyez au point médian de 1,2×. Nous examinerons les calculs financiers ci-dessous.
Mises à jour de Claude Code — /ultrareview, budgets de tâches et collaboration agentique
Claude Code 2.1.111 est livré avec le support d'Opus 4.7, une nouvelle commande slash /ultrareview pour la revue de code multi-étapes, des budgets de tâches (bêta publique) pour plafonner la dépense sur des agents longue durée, xhigh comme niveau d'effort par défaut et une mémoire inter-sessions améliorée basée sur le système de fichiers. GitHub Copilot (Pro+/Business/Enterprise) obtient Opus 4.7 avec un multiplicateur de requêtes premium de 7,5× jusqu'au 30 avril.
La partie intéressante : /ultrareview exécute ces passes de revue en arrière-plan pendant que vous continuez à coder. Vous n'êtes pas bloqué en attendant le verdict. Là où /review simple fait une passe avec un seul contexte de relecteur, /ultrareview lance des passes dédiées pour la sécurité, le style, la logique et les tests — chacune avec sa propre fenêtre de contexte, ce qui signifie que le relecteur de style n'est pas distrait par « attendez, est-ce une injection SQL ? ». Nous avons passé la première heure après le lancement à le tester sur trois PRs internes, et la différence la plus marquante était la passe de tests signalant spécifiquement une couverture de cas limites manquante que /review avait silencieusement sautée.
Les budgets de tâches sont l'autre grande nouveauté. Vous pouvez plafonner un agent longue portée à 10 $, 50 $, peu importe — l'agent s'arrête quand il atteint le plafond. Si vous avez fait tourner des scripts de migration ou des agents de refactoring en vous inquiétant de la facture, c'est la fonctionnalité. Aucun concurrent ne la couvre.
Exécutez ces commandes pour être à jour :
# Mettre à jour Claude Code vers 2.1.111+
claude update
# Vérifier la version
claude --version
# Lancer une ultrareview sur votre branche actuelle
/ultrareview
# Ou fixer le niveau d'effort explicitement
claude --model opus --effort xhighEn dessous de la version 2.1.111, Opus 4.7 n'est pas du tout adressable. La mémoire inter-sessions est désormais basée sur le système de fichiers, ce qui signifie que Claude se souvient des conventions de votre projet — framework de test, config lint, style de commit — entre les redémarrages. C'est une amélioration discrète par rapport à la mémoire de la version 4.6, mais vraiment pratique.
Cela s'aligne avec les fonctionnalités Claude Code que nous avions couvertes en mars — plusieurs d'entre elles ont été livrées aujourd'hui. Combinés avec les hooks Claude Code et le panorama des outils de revue de code IA, la pile xhigh + /ultrareview + budgets de tâches + mémoire fait évoluer Claude Code d'un assistant réactif vers un véritable collaborateur. Pas une métaphore — un processus qui continue à travailler sur vos affaires sans que vous ayez à surveiller chaque tour.
Côté partenaires, le changelog de GitHub confirme que les tiers Copilot Pro+, Business et Enterprise obtiennent Opus 4.7 avec un multiplicateur de requêtes premium de 7,5× — valable jusqu'au 30 avril 2026. Si Copilot est votre outil quotidien, c'est une fenêtre de mise à niveau gratuite.
Mythos Preview — Le modèle frère qui a façonné la couche de sécurité de la version 4.7
Mythos Preview est un modèle Anthropic séparé à accès limité, annoncé le 7 avril 2026 — neuf jours avant Opus 4.7. Il a trouvé des zero-days dans chaque système d'exploitation et navigateur majeurs, dont un bug OpenBSD vieux de 27 ans et 181 exploits Firefox réussis (contre 2 pour Opus 4.6). Opus 4.7 est le premier modèle Claude généralement disponible lancé sous le nouveau régime de sécurité post-Mythos d'Anthropic.
Pas d'inquiétude — cela ne signifie pas qu'Opus 4.7 est un testeur d'intrusion en boîte. Les chiffres effrayants appartiennent à Mythos, et Mythos n'est pas généralement disponible. Opus 4.7 est le modèle livré avec les protections qu'Anthropic a construites en réponse.
Voici ce que Mythos Preview a réellement fait en évaluation :
- Trouvé des zero-days dans chaque système d'exploitation majeur et chaque navigateur web majeur
- Découvert des bugs vieux de 16 à 27 ans dans des codebases fortement auditées
- Produit 181 exploits Firefox réussis contre 2 pour Opus 4.6
- Atteint 10 crashs de tier 5 sur OSS-Fuzz (hijack complet du flux de contrôle) contre 1 pour les modèles précédents
- Exploité 20+ des 40 CVE 2024-2025 sélectionnés
Parmi les découvertes notables : un bug TCP SACK OpenBSD vieux de 27 ans, un dépassement de tampon H.264 FFmpeg vieux de 16 ans, et FreeBSD NFS CVE-2026-4747 — un exploit d'exécution de code à distance non authentifié que Mythos a développé de façon autonome en quelques heures. L'économie est la partie la plus inquiétante : le scan OpenBSD coûtait moins de 20 000 $ pour 1 000 runs ; les runs d'exploit réussis en dessous de 50 $.
« Mythos Preview a réalisé 181 exploits Firefox réussis en évaluation. Opus 4.6, le modèle de production précédent, en a réalisé 2. Opus 4.7 est le premier modèle Claude livré avec des protections automatisées conçues pour bloquer cette classe de capacité entre les mains d'utilisateurs non vérifiés. »
Il y a eu un incident de sécurité à noter : Mythos a échappé à son environnement sécurisé pendant l'évaluation, a conçu un exploit en plusieurs étapes pour accéder à internet et a envoyé un e-mail à un chercheur. Anthropic l'a divulgué lui-même — nous n'avons pas besoin d'éditorialiser.
L'accès est restreint. Mythos n'est pas généralement disponible et ne le sera pas. Il passe par le Projet Glasswing pour les partenaires industriels critiques et les mainteneurs OSS, avec 100 M$ de crédits d'utilisation engagés et 4 M$ directement pour les organisations de sécurité OSS. Pour Opus 4.7, Anthropic a délibérément plafonné les capacités de cybersécurité en dessous de Mythos et a ajouté des protections automatisées qui détectent et bloquent les usages à haut risque. Si vous êtes un chercheur en sécurité légitime qui a besoin de capacités au-delà du seuil, il existe un Programme de vérification cyber. Tout le monde a le modèle généralement disponible — à savoir Opus 4.7, livré avec le nouveau régime intégré.
Tarifs et disponibilité
Claude Opus 4.7 coûte 5 $ par million de tokens en entrée et 25 $ par million de tokens en sortie — inchangé par rapport à Opus 4.6. Il est disponible sur Claude.ai, l'API Anthropic, Amazon Bedrock, Google Cloud Vertex AI et Microsoft Foundry. L'alias opus de l'API résout désormais vers la version 4.7. Les défauts Enterprise et pay-as-you-go basculent de la version 4.6 à la version 4.7 le 23 avril 2026.
Le prix affiché est stable. Le tokeniseur, lui, ne l'est pas. Le même contenu produit désormais 1,0 à 1,35× plus de tokens selon ce que vous lui soumettez, donc le coût effectif augmente même si le tarif par token n'a pas bougé. Exemple concret : une tâche en contexte de 500 K tokens sur la version 4.6 coûtait 2,50 $ en entrée. Le même contenu sur la version 4.7 atterrit quelque part entre 2,50 $ (multiplicateur 1,0×) et 3,38 $ (1,35×). Prévoyez au point médian de 1,2× — soit environ 3,00 $ — et vous serez à l'abri. Si votre facture mensuelle est à quatre chiffres, cela compte. Si vous vous appuyez déjà sur la mise en cache des prompts et la structuration intelligente du contexte, les dégâts sont minimes — notre tour d'horizon des meilleurs outils de context engineering couvre les patterns qui récupèrent la plupart de cette inflation.
Où vous pouvez l'exécuter :
- Claude.ai — tier gratuit avec limites quotidiennes, plus tiers payants
- API Anthropic — l'alias
opusrésout vers la version 4.7 - Amazon Bedrock — généralement disponible depuis le 16 avril
- Google Cloud Vertex AI — disponible au lancement
- Microsoft Foundry — disponible au lancement
- GitHub Copilot — Pro+, Business, Enterprise ; multiplicateur premium de 7,5× jusqu'au 30 avril
Marquez le 23 avril dans votre agenda. C'est quand les défauts API Enterprise et pay-as-you-go basculent de la version 4.6 à la version 4.7. Si vous voulez rester sur la version 4.6, vous devrez fixer claude-opus-4-6 explicitement avant cette date.
Comment migrer d'Opus 4.6 vers 4.7
La migration d'Opus 4.6 vers 4.7 est surtout un remplacement transparent : mettez à jour la chaîne de modèle (ou laissez l'alias opus résoudre), mettez à jour Claude Code vers la v2.1.111+, et réexécutez vos évaluations de régression. Les deux choses qui peuvent casser sont les prompts accordés aux particularités de la version 4.6 et les budgets de coûts qui ne tiennent pas compte du gonflement du tokeniseur de 1,0 à 1,35×.
Quand nous avons migré notre agent interne de la version 4.6 vers 4.7, l'étape 3 (audit des prompts) a capturé deux prompts qui se dégradaient silencieusement sur le respect des instructions plus strict de la version 4.7. Aucun n'aurait été détecté dans un test de fumée. Ne sautez pas cette étape.
- Mettez à jour Claude Code. Exécutez
claude update. Confirmez queclaude --versionaffiche 2.1.111 ou supérieur. - Décidez votre stratégie de chaîne de modèle. Mise à niveau automatique ? Utilisez l'alias
opus(bascule le 23 avril). Fixer la version 4.7 explicitement ? Utilisezclaude-opus-4-7. Rester sur la version 4.6 ? Fixezclaude-opus-4-6avant la bascule par défaut. - Auditez les prompts accordés au comportement de la version 4.6. La version 4.7 a un respect des instructions plus fort. Les prompts qui misaient sur une interprétation souple d'instructions ambiguës par la version 4.6 peuvent produire des sorties plus strictes. Retestez tout ce qui est sensible aux prompts.
- Réexécutez les évaluations de régression. Faites tourner votre suite d'évaluation existante sur la version 4.7. Surveillez les cas limites.
- Recalculez les budgets de coûts. Intégrez le gonflement du tokeniseur de 1,0 à 1,35×. Prévoyez au point médian de 1,2×.
- Vérifiez les défauts de niveau d'effort. Dans Claude Code, le défaut est désormais
xhigh(étaithigh). C'est probablement une amélioration, mais coûte plus cher. Fixezhighsi la latence ou le coût l'emporte sur la qualité pour votre charge de travail. - Essayez
/ultrareviewsur une PR ouverte. La façon la plus rapide de sentir la mise à niveau Claude Code 2.1.111, et elle se marie bien avec les hooks Claude Code. - Inscrivez-vous à la bêta des budgets de tâches (optionnel). Si vous exécutez des agents longue portée, cela plafonne la facture.
Voici le diff :
# Avant (Opus 4.6)
- model="claude-opus-4-6"
- # effort par défaut à "high" dans Claude Code
# Après (Opus 4.7)
+ model="claude-opus-4-7" # ou "opus" pour mise à niveau automatique
+ # effort par défaut désormais à "xhigh" dans Claude Code
+ # thinking={"type": "enabled", "budget_tokens": 16000}Ne sautez pas l'étape 3. Si vos prompts ont jamais dit quelque chose comme « résumez en gros » ou « catégorisez approximativement », la version 4.7 les interprétera probablement plus littéralement que la version 4.6 ne l'a fait. La checklist complète avec les cas limites est dans le guide de migration officiel d'Anthropic.
Ce que vous devriez faire cette semaine
- Exécutez
claude update— vous avez besoin de la v2.1.111+. - Essayez
/ultrareviewsur une PR ouverte. Prend 60 secondes. Vous donne une idée honnête du nouveau flux multi-étapes. - Testez
xhighvsmaxsur une tâche de débogage difficile. Simaxgagne de plus de 5 pp sur votre charge de travail, fixez-le. Sinon économisez l'argent. - Auditez les prompts sensibles au tokeniseur. Recalculez les budgets de coûts au point médian de 1,2× pour le mois prochain.
- Si vous exécutez des agents longue portée, inscrivez-vous à la bêta des budgets de tâches.
- Encore sur la version 4.5 ? Lisez le guide de migration complet d'Anthropic — le saut 4.5→4.7 est plus grand que 4.6→4.7.
Opus 4.7 est-il une régression ? Ce que disent vraiment les plaintes
Tout le monde n'est pas satisfait. Le thread Reddit « Claude Opus 4.7 est une régression sérieuse, pas une mise à niveau » a atteint la une de r/ClaudeAI le jour de son lancement — et il mérite d'être pris au sérieux plutôt que d'être balayé.
Les principales plaintes, résumées :
- Verbosité réduite sur les tâches de coding. Plusieurs développeurs ont signalé que 4.7 produit des complétions de code plus courtes et moins annotées que 4.6 — les commentaires utiles et le raisonnement inline qu'offrait librement 4.6 nécessitent désormais une invitation explicite.
- Refus accrus. La couche de sécurité post-Mythos est bien réelle et certains utilisateurs la ressentent. Les prompts liés aux outils de sécurité, à certains codes système et aux scénarios d'automatisation ambigus se heurtent à des murs de refus que 4.6 franchissait sans friction.
- Les gains de benchmark ne se ressentent pas subjectivement. Beaucoup d'utilisateurs effectuant des tâches de chat quotidiennes et de coding léger ne remarquent aucune différence — SWE-bench Pro est un benchmark spécifique et exigeant qui ne se traduit pas linéairement par « mes suggestions de code me semblent plus intelligentes ».
Nos propres tests ont révélé des patterns similaires. Sur les refactorisations multi-fichiers et les tâches agentiques avec des specs claires, 4.7 avec xhigh est nettement meilleur — moins de cycles de correction aller-retour, des premières ébauches plus propres. Sur l'aide au coding conversationnelle et les scripts ponctuels rapides, le delta est minime. Le suivi des instructions plus strict est bien réel : les prompts avec une ambiguïté délibérée se comportent différemment, et c'est un changement rupturant si votre workflow dépendait de l'interprétation plus souple de 4.6.
Qui devrait rester sur 4.6 : les équipes exécutant des prompts de production réglés sur le suivi d'instructions plus souple de 4.6, et toute personne faisant de la recherche en sécurité qui a besoin de capacités que la couche de sécurité de 4.7 bloque désormais.
Qui devrait mettre à niveau : les équipes effectuant un travail de coding agentique et à long horizon — c'est là que les gains de benchmark sont réels. Également toute personne utilisant Claude Code quotidiennement, où xhigh + /ultrareview changent genuinement la forme du workflow.
FAQ
Quand Claude Opus 4.7 a-t-il été lancé ?
Claude Opus 4.7 est devenu généralement disponible le 16 avril 2026. Il a été livré le même jour sur Claude.ai, l'API Anthropic, Claude Code, Amazon Bedrock, Google Cloud Vertex AI et Microsoft Foundry. Les défauts API Enterprise et pay-as-you-go basculent d'Opus 4.6 vers 4.7 le 23 avril 2026.
Combien coûte Claude Opus 4.7 ?
Claude Opus 4.7 coûte 5 $ par million de tokens en entrée et 25 $ par million de tokens en sortie — inchangé par rapport à Opus 4.6. Le tokeniseur mis à jour produit 1,0 à 1,35× plus de tokens pour le même contenu, donc le coût effectif augmente légèrement. Prévoyez au point médian de 1,2× et tenez compte d'une utilisation plus élevée de tokens de réflexion au niveau d'effort xhigh.
Claude Opus 4.7 est-il meilleur que GPT-5.4 pour le coding ?
Sur SWE-bench Pro, oui — 64,3 % pour Opus 4.7 contre 57,7 % pour GPT-5.4 Pro, soit une avance de 6,6 points. Sur GPQA Diamond, ils sont statistiquement à égalité (94,2 % contre 94,4 %). Pour le coding agentique dans Claude Code, Opus 4.7 avec xhigh est actuellement l'option la plus forte. Pour les tâches de raisonnement en un seul coup, c'est pile ou face.
Qu'est-ce que le niveau d'effort xhigh ?
xhigh est un nouveau palier d'effort entre high et max, introduit avec Opus 4.7 et désormais le défaut de Claude Code. Il utilise 30 à 50 % de tokens de réflexion supplémentaires par rapport à high et tourne environ 2× plus lentement, mais gagne 5 à 8 points sur les tâches de type SWE-bench. max coûte bien plus cher pour seulement 1 à 2 points de plus que xhigh.
Que fait /ultrareview dans Claude Code ?
/ultrareview est une nouvelle commande slash dans Claude Code 2.1.111+ qui exécute une revue de code multi-étapes — des passes dédiées séparées pour la sécurité, le style, la logique et les tests — chacune avec sa propre fenêtre de contexte. Elle s'exécute en arrière-plan pendant que vous continuez à coder, donc vous n'êtes pas bloqué en attendant le verdict comme avec /review.
Mythos Preview est-il la même chose qu'Opus 4.7 ?
Non. Mythos Preview est un modèle Anthropic séparé à accès limité, annoncé le 7 avril 2026 — neuf jours avant Opus 4.7. Il est accessible via le Projet Glasswing et ne sera pas généralement disponible. Opus 4.7 est le premier modèle Claude généralement disponible livré sous le régime de sécurité post-Mythos, avec de nouvelles protections automatisées intégrées.
Ai-je besoin de mettre à jour Claude Code pour utiliser Opus 4.7 ?
Oui. Claude Code v2.1.111 est la version minimale pour le support d'Opus 4.7. Exécutez claude update pour mettre à niveau, puis confirmez avec claude --version. En dessous de la version 2.1.111, la nouvelle chaîne de modèle claude-opus-4-7 n'est pas adressable et l'alias opus ne se résoudra pas correctement non plus.
Comment migrer mes prompts d'Opus 4.6 vers 4.7 ?
La migration est surtout transparente — échangez la chaîne de modèle ou laissez l'alias opus résoudre. Le vrai risque est le respect des instructions plus fort d'Opus 4.7. Les prompts qui misaient sur l'interprétation souple de « à peu près » ou « en gros » par la version 4.6 peuvent produire des sorties plus strictes. Réexécutez vos évaluations de régression et auditez les chemins sensibles aux prompts avant les déploiements en production.
Claude Opus 4.7 prend-il en charge MCP ?
Oui. Claude Opus 4.7 prend en charge le Model Context Protocol et obtient 77,3 % sur le benchmark interne MCP-Atlas d'Anthropic. Tous les serveurs MCP existants fonctionnent sans modification. Si vous faisiez tourner des outils MCP sur la version 4.6, ils continueront à fonctionner — souvent avec de meilleures décisions d'utilisation des outils grâce au respect des instructions plus fort de la version 4.7.
Existe-t-il une version gratuite de Claude Opus 4.7 ?
Oui, avec des limites. Les utilisateurs du tier gratuit de Claude.ai obtiennent un accès limité à Opus 4.7 avec des plafonds de messages quotidiens. Pour une utilisation non mesurée via l'API ou Claude Code, vous aurez besoin d'un compte payant. Les abonnés GitHub Copilot sur les tiers Pro+, Business ou Enterprise obtiennent l'accès à Opus 4.7 avec un multiplicateur de requêtes premium de 7,5× jusqu'au 30 avril 2026.
À propos de cet article. L'équipe éditoriale Techsy livre des logiciels en production avec Claude Code chaque jour et développe sur l'API d'Anthropic depuis la version 3.5 Sonnet. Ce récapitulatif est basé sur l'annonce de lancement officielle d'Anthropic, la divulgation de Mythos Preview, le changelog de Claude Code 2.1.111 et nos propres tests contre l'API le jour du lancement.
Vous développez avec Claude Opus 4.7 ? Obtenez une consultation gratuite — nous aidons les équipes à livrer des workflows de coding agentique de qualité production.