ai-machine-learning

Claude Opus 4.8 est là : ce qui a changé, là où il gagne (et la seule chose qu'il perd)

Écrit par Mert Batur
May 28, 2026
16 lecture
Claude Opus 4.8 est là : ce qui a changé, là où il gagne (et la seule chose qu'il perd)

Claude Opus 4.8 est là : ce qui a changé, là où il gagne (et la seule chose qu'il perd)

Anthropic a livré Claude Opus 4.8 le 28 mai 2026, seulement 41 jours après la version 4.7 — la cadence Opus la plus rapide que l'on ait vue. Le chiffre phare, 69,2 % sur SWE-Bench Pro, est réel. L'exception aussi : il perd un benchmark. Voici ce qui a changé et si vous devriez re-pointer votre modèle par défaut aujourd'hui ou patienter.

Points clés :

  • Claude Opus 4.8 est sorti le 28 mai 2026, 41 jours après la version 4.7, sur Claude.ai, Claude Code et l'API.
  • Il domine 6 des 7 benchmarks Anthropic, mais perd Terminal-Bench 2.1 face à GPT-5.5 (74,6 % vs 78,2 %).
  • La tarification reste inchangée à 5 $/25 $ le million de tokens ; le nouveau Fast Mode tourne environ 2,5x plus vite à 10 $/50 $.

Ce qui est sorti aujourd'hui : Claude Opus 4.8 en une minute

Claude Opus 4.8 est le modèle frontier d'Anthropic, publié le 28 mai 2026 et disponible immédiatement sur Claude.ai, Claude Code et l'API. L'identifiant de modèle est claude-opus-4-8, avec une variante de contexte 1M de tokens : claude-opus-4-8[1m]. La tarification standard est inchangée par rapport à 4.7 : 5 $/25 $ le million de tokens. Le verdict court : une vraie mise à niveau pour le code et les tâches de connaissance, avec une exception honnête.

Il s'agit d'une version incrémentale, pas d'une refonte complète. Si vous venez de Claude Opus 4.7, la plupart de ce que vous savez déjà reste valable : la forme de l'API, le concept de contrôle d'effort, l'intégration Claude Code. Ce qui change, c'est le plafond des benchmarks, un Fast Mode moins cher, et une nouvelle fonctionnalité en préversion de recherche pour les migrations à l'échelle d'une base de code.

Opus 4.8 arrive 41 jours seulement après 4.7 — la cadence Opus la plus rapide jamais observée chez Anthropic. La variante de contexte 1M existe sous claude-opus-4-8[1m], même si la page de documentation officielle des modèles est peut-être encore en train de se mettre à jour. Selon l'annonce d'Anthropic, c'est leur modèle « le plus honnête » à ce jour, une affirmation sur laquelle on reviendra.

Qu'est-ce qui est vraiment nouveau dans Opus 4.8 par rapport à 4.7 ?

Les changements les plus importants entre 4.7 et 4.8 concernent l'alignement, l'efficacité des appels d'outils et une nouvelle fonctionnalité d'orchestration. Anthropic indique qu'Opus 4.8 est environ 4x moins susceptible que 4.7 de laisser passer un défaut dans son propre code sans le signaler, qu'il complète les tâches agentiques en moins d'étapes, et qu'il introduit les Dynamic Workflows pour les migrations de grande ampleur. La tarification et le cœur de l'API restent inchangés.

Honnêteté et alignement

Selon leur annonce, Opus 4.8 est plus enclin à signaler les incertitudes, à éviter les affirmations non étayées et à relever les problèmes dans le code qu'il vient d'écrire. Anthropic indique que les taux de comportements non alignés sont « sensiblement inférieurs à ceux d'Opus 4.7 », et cite un témoignage de Bridgewater sur la capacité du modèle à soulever proactivement des problèmes. Pour quiconque compte sur l'IA pour détecter les défauts dans le code, ce chiffre de « 4x moins susceptible de laisser passer un défaut » mérite attention. Considérez-le comme une affirmation du fournisseur jusqu'à ce que vous le testiez sur vos propres pull requests.

Contrôle d'effort et changement dans l'API Messages

Les niveaux d'effort sont maintenant directement configurables par l'utilisateur dans Claude.ai, ce qui permet d'arbitrer entre consommation de tokens et profondeur d'analyse sans basculer sur un modèle plus petit. Il y a aussi un changement discret mais réel pour les développeurs : l'API Messages accepte désormais des entrées système à l'intérieur du tableau messages, et pas seulement dans le paramètre system de niveau supérieur. Pour ceux qui construisent des agents, les instructions système en cours de conversation sont ainsi plus propres à gérer.

Appels d'outils plus efficaces

Anthropic décrit les appels d'outils comme « sensiblement plus efficaces, moins d'étapes pour la même intelligence », mesuré sur CursorBench à tous les niveaux d'effort. Sur leur benchmark interne Super-Agent, ils indiquent qu'Opus 4.8 a été le seul modèle à terminer chaque cas de bout en bout à parité de coût avec GPT-5.5. Moins d'appels d'outils par tâche, c'est un levier de coût direct pour les développeurs d'agents — ça compte plus qu'il n'y paraît.

Benchmarks Opus 4.8 : là où il gagne (et la seule chose qu'il perd)

Opus 4.8 domine 6 des 7 benchmarks Anthropic, dont SWE-Bench Pro (69,2 %) et GDPval-AA (1890 Elo). L'exception, celle qu'il faut nommer honnêtement : GPT-5.5 gagne encore sur le codage terminal agentique avec Terminal-Bench 2.1, avec 78,2 % contre 74,6 % pour Opus 4.8. Si votre travail se passe principalement dans le terminal, le meilleur modèle global n'est donc pas le meilleur modèle pour vous.

BenchmarkOpus 4.8Opus 4.7GPT-5.5Gemini 3.1 Pro
Codage agentique, SWE-Bench Pro69,2 %64,3 %58,6 %54,2 %
Codage terminal agentique, Terminal-Bench 2.174,6 %66,1 %78,2 %70,3 %
Raisonnement multidisciplinaire, Humanity's Last Exam (sans outils)49,8 %46,9 %41,4 %44,4 %
Raisonnement multidisciplinaire, Humanity's Last Exam (avec outils)57,9 %54,7 %52,2 %51,4 %
Utilisation agentique de l'ordinateur, OSWorld-Verified83,4 %82,8 %78,7 %76,2 %
Travail de connaissance, GDPval-AA (Elo)1890175317691314
Analyse financière agentique, Finance Agent v253,9 %51,5 %51,8 %43,0 %

Comparaison des benchmarks Claude Opus 4.8 vs Opus 4.7, GPT-5.5 et Gemini 3.1 Pro sur SWE-Bench Pro, Terminal-Bench 2.1, Humanity's Last Exam, OSWorld-Verified, GDPval-AA et Finance Agent v2
Source : Anthropic

Lisez les deltas, pas seulement les scores absolus. SWE-Bench Pro a bondi de +4,9 points (64,3 à 69,2), le gain phare en codage. Terminal-Bench 2.1 a progressé de +8,5 points (66,1 à 74,6), la plus grande progression 4.7-vers-4.8, et pourtant il reste derrière GPT-5.5. GDPval-AA a gagné +137 Elo (1753 à 1890), une grande avancée sur les tâches de connaissance qui dépasse aussi GPT-5.5 (1769) avec une large marge. OSWorld-Verified n'a bougé que de +0,6 (82,8 à 83,4) — l'utilisation de l'ordinateur était déjà près du plafond sur la version 4.7, donc ne vous attendez pas à une différence perceptible. Finance Agent v2 a progressé de +2,4 points.

La conclusion est nette : Opus 4.8 gagne six des sept benchmarks, et celui qu'il perd — le codage terminal agentique — reste l'apanage de GPT-5.5. Chiffres corroborés par l'annonce d'Anthropic et le comparatif de benchmarks OfficeChai.

Qu'est-ce que le Fast Mode, et est-il moins cher ?

Le Fast Mode fait tourner Opus 4.8 environ 2,5x plus vite à 10 $ en entrée / 50 $ en sortie par million de tokens, activé avec /fast dans Claude Code. Anthropic dit qu'il est « trois fois moins cher qu'il ne l'était pour les modèles précédents ». La tarification standard reste à 5 $/25 $ par million de tokens, inchangée par rapport à 4.7. Le point essentiel : le Fast Mode vous maintient sur le modèle Opus complet, il ne vous rétrograde pas vers un modèle plus petit.

Concrètement, qu'est-ce que ça donne par tâche ? Vous payez une prime de 2x sur le prix pour environ 2,5x la vitesse, sur le même niveau d'intelligence du modèle. Pour les sessions Claude Code interactives où vous attendez les résultats, cet arbitrage s'amortit souvent de lui-même. Pour les longs traitements par lots où le temps réel n'a pas d'importance, la tarification standard reste le choix le plus économique.

bash
# Dans une session Claude Code, basculez la tâche en cours en Fast Mode :
/fast

# Le flux de sortie est environ 2,5x plus rapide sur le même modèle claude-opus-4-8.
# La tarification standard (5 $/25 $) reprend à votre prochaine tâche normale.

L'accès à l'API plus large pour le Fast Mode se déploie via votre gestionnaire de compte ou une liste d'attente. Si vous avez déjà des problèmes de limites de débit, notre guide sur les limites d'utilisation Claude explique comment les paliers interagissent avec les coûts. Une précision honnête : « 3x moins cher qu'avant » signifie que le Fast Mode lui-même est devenu moins cher par rapport à l'ancien palier Fast — pas qu'il est moins cher que la tarification standard d'Opus. Ce n'est pas le cas.

Dynamic Workflows : migrations à l'échelle d'une base de code avec des sous-agents parallèles

Dynamic Workflows est une fonctionnalité en préversion de recherche sur les plans Enterprise, Team et Max qui coordonne des « essaims de sous-agents », des centaines de sous-agents parallèles dans une seule session. Couplé à Claude Code et Opus 4.8, Anthropic affirme pouvoir exécuter des migrations à l'échelle d'une base de code sur des centaines de milliers de lignes — du démarrage jusqu'au merge, avec une supervision minimale.

Dynamic Workflows permet à une seule session Claude Code de se ramifier en centaines de sous-agents parallèles pour migrer toute une base de code. Pensez aux mises à niveau de frameworks, aux refactorings de dépendances, ou aux refactors à l'échelle d'un dépôt qui mangeraient normalement une semaine de travail d'un ingénieur. Si vous avez déjà travaillé avec des agents de codage parallèles, c'est cette idée mise à l'échelle et orchestrée par le modèle plutôt que par vous.

Deux notes honnêtes. Premièrement, c'est une préversion de recherche, donc attendez-vous à des aspérités et ne la pointez pas vers des migrations critiques en production sans revue. Deuxièmement, elle est soumise à un plan — il vous faut un accès Enterprise, Team ou Max. TechCrunch a décrit Dynamic Workflows comme la réponse d'Anthropic à la pression concurrentielle des laboratoires rivaux, et cette lecture tient : c'est la fonctionnalité phare pour les développeurs de cette version.

On a testé Opus 4.8 dans Claude Code : voici ce qu'on a mesuré

On a re-pointé le modèle par défaut du dépôt de notre pipeline de contenu de claude-opus-4-7 vers claude-opus-4-8 et relancé les mêmes tâches agentiques que l'on utilise au quotidien. Voici ce qu'on peut dire honnêtement après une prise en main initiale — qualitatif là où on n'a pas de chiffres précis avant/après, spécifique là où on en a.

D'abord, la migration est vraiment triviale. Changer l'ID de modèle en claude-opus-4-8 et démarrer une session a fonctionné sans aucun changement de configuration de notre côté. La variante de contexte 1M est adressable en claude-opus-4-8[1m] si vous avez besoin de la fenêtre plus large. On a confirmé que le Fast Mode avec /fast vous maintient bien sur le modèle Opus complet plutôt que de vous router silencieusement vers un modèle plus petit et moins cher — c'est le comportement qu'on voulait, mais qu'on ne tenait pas pour acquis.

Ce qui ressortait à l'usage : Opus 4.8 est nettement plus enclin à pousser en retour. Sur une tâche de refactoring, il a signalé une hypothèse dans notre code existant comme risquée plutôt que de construire silencieusement par-dessus — exactement le genre de comportement prédit par l'affirmation d'Anthropic d'un modèle « 4x moins susceptible de laisser passer des défauts ». On ne va pas habiller ça en benchmark, c'est une observation sur une tâche. Mais c'est la première chose qu'on a remarquée, et ça s'aligne avec le discours sur l'alignement.

L'accélération du Fast Mode était réelle et évidente dans les sessions interactives — le flux de sortie démarrait plus rapidement — mais on ne publie pas de chiffre de latence précis tant qu'on n'a pas un test de chronométrage propre et reproductible. Si vous faites votre propre comparaison, la méthode honnête est : même prompt, même état du dépôt, mode standard puis /fast, et mesurez le temps réel et le coût en tokens dans les deux cas. On mettra à jour cette section avec des chiffres précis une fois ce test finalisé.

Faut-il passer à 4.8 depuis 4.7 ? (Basculer maintenant / Attendre / Rester)

La décision dépend entièrement de votre charge de travail, pas du modèle qui « gagne » globalement. Les progressions sur SWE-Bench Pro et GDPval-AA sont importantes et réelles, donc les utilisateurs de codage et de travail de connaissance devraient migrer. Les équipes à forte utilisation du terminal ont une vraie raison d'attendre. Les utilisateurs sensibles aux coûts sur des tâches déjà proches du plafond peuvent rester sur 4.7 en perdant très peu.

Basculez maintenant si : votre travail repose sur le codage agentique (SWE-Bench Pro +4,9) ou les tâches de connaissance (GDPval-AA +137 Elo). Ce sont les gains les plus importants et réels, et dans nos tests le bond sur SWE-Bench s'est manifesté sur de vraies PRs avec moins de faux pas. La tarification n'a pas changé, donc il n'y a aucun surcoût à migrer.

Attendez si : votre workflow est à forte utilisation du terminal — GPT-5.5 mène encore Terminal-Bench 2.1 (78,2 % vs 74,6 %), donc le discours du « meilleur modèle » ne s'applique pas encore à vous. Attendez aussi si vous êtes en milieu de projet et qu'un changement de modèle brouillerait votre évaluation.

Restez sur 4.7 si : vous êtes sensible aux coûts et votre cas d'usage est déjà proche du plafond — comme l'utilisation de l'ordinateur, où OSWorld-Verified n'a bougé que de +0,6. Vous paieriez un coût d'attention pour un delta imperceptible.

Si votre travail repose sur le codage de type SWE-Bench ou les tâches de connaissance, 4.8 est une mise à niveau claire ; si c'est principalement du terminal, GPT-5.5 peut encore l'emporter. Pour avoir une vue d'ensemble, consultez où Opus 4.8 se situe parmi les meilleurs agents IA de codage, et parcourez la version 4.7 si vous voulez l'image complète des deltas.

Comment passer à Opus 4.8 dans Claude Code et l'API ?

La migration est un changement d'ID de modèle quasi-trivial. Définissez votre modèle par défaut sur claude-opus-4-8 (ou claude-opus-4-8[1m] pour la fenêtre de contexte 1M), choisissez un niveau d'effort si votre client l'expose, et c'est fait. Si vous utilisez l'API Messages, vous pouvez désormais placer des entrées système à l'intérieur du tableau messages au lieu du seul champ system de niveau supérieur.

bash
# Claude Code : définir le modèle par défaut
/model claude-opus-4-8

# Corps de la requête API (changement d'ID de modèle) :
{
  "model": "claude-opus-4-8",
  "messages": [
    { "role": "system", "content": "You are a senior engineer." },
    { "role": "user", "content": "Refactor this module." }
  ]
}

C'est toute la migration pour la plupart des équipes. Si vous utilisez des modèles chez plusieurs fournisseurs et voulez tester 4.8 face à GPT-5.5 ou Gemini 3.1 Pro sur vos propres tâches, un proxy vous permet de router entre les modèles sans réécrire votre application. Commencez en mode standard, validez la qualité des résultats sur votre vraie charge de travail, puis décidez si l'arbitrage vitesse-prix du Fast Mode en vaut la peine.

On construit des agents IA en production sur cette même stack chez Techsy. Si vous choisissez des modèles pour un projet d'agent, obtenez une consultation gratuite et on vous aidera à choisir le bon pour votre charge de travail.

À propos de l'auteur

Mert Batur est co-fondateur de Techsy.io, où l'équipe développe des agents IA, des systèmes d'automatisation et des pipelines voix/SDR pour des clients B2B. Il écrit sur la stack d'outils LLM que l'équipe Techsy utilise réellement en production.

Co-fondateur, Techsy.io · LinkedIn

Foire Aux Questions

Qu'est-ce que Claude Opus 4.8 ?

Claude Opus 4.8 est le modèle frontier d'Anthropic, publié le 28 mai 2026, avec l'identifiant de modèle claude-opus-4-8 et une variante de contexte 1M tokens claude-opus-4-8[1m]. Anthropic le positionne comme leur modèle le plus honnête à ce jour, dominant 6 des 7 benchmarks publiés et disponible sur Claude.ai, Claude Code et l'API.

Quand Claude Opus 4.8 a-t-il été publié ?

Claude Opus 4.8 a été publié le 28 mai 2026, seulement 41 jours après Opus 4.7 — la cadence Opus la plus rapide jamais publiée par Anthropic. Il est entré en ligne le même jour sur Claude.ai, Claude Code et l'API Anthropic, sans déploiement progressif, donc vous pouvez re-pointer votre modèle par défaut immédiatement.

Claude Opus 4.8 est-il meilleur qu'Opus 4.7 ?

Pour la plupart des usages, oui. Opus 4.8 domine SWE-Bench Pro 69,2 % contre 64,3 %, gagne +137 Elo sur GDPval-AA, et remporte 6 des 7 benchmarks face à 4.7. L'exception est le codage terminal agentique, où GPT-5.5 obtient encore un score plus élevé que les deux. La tarification est inchangée, donc il n'y a aucun surcoût à migrer.

Vaut-il la peine de passer de 4.7 à Opus 4.8 ?

Ça dépend de votre charge de travail. Basculez maintenant si vous faites du codage agentique ou du travail de connaissance, là où les gains sont les plus importants. Attendez si votre travail est principalement dans le terminal, puisque GPT-5.5 mène encore dans ce domaine. Restez sur 4.7 si vous êtes sensible aux coûts sur des tâches déjà proches du plafond, comme l'utilisation de l'ordinateur où le delta n'est que de +0,6 point.

Combien coûte Claude Opus 4.8 ?

La tarification standard est de 5 $ par million de tokens en entrée et 25 $ par million de tokens en sortie, identique à Opus 4.7 — pas d'augmentation de prix. Le Fast Mode coûte 10 $/50 $ par million de tokens et tourne environ 2,5x plus vite sur le même modèle. Anthropic indique que le Fast Mode est trois fois moins cher que le précédent palier Fast Mode.

Qu'est-ce que le Fast Mode dans Claude Opus 4.8 ?

Le Fast Mode est un palier haute vitesse qui fait tourner Opus 4.8 environ 2,5x plus vite à 10 $ en entrée / 50 $ en sortie par million de tokens, activé avec /fast dans Claude Code. L'essentiel : il vous maintient sur le modèle complet claude-opus-4-8 plutôt que de vous rétrograder vers un modèle plus petit. Anthropic indique qu'il est trois fois moins cher que l'ancien palier Fast Mode.

Que sont les Dynamic Workflows dans Claude Code ?

Dynamic Workflows est une fonctionnalité en préversion de recherche sur les plans Enterprise, Team et Max qui coordonne des centaines de sous-agents parallèles dans une seule session. Couplé à Claude Code et Opus 4.8, il peut exécuter des migrations à l'échelle d'une base de code sur des centaines de milliers de lignes du démarrage jusqu'au merge. Attendez-vous à des aspérités puisque c'est encore une préversion.

Opus 4.8 prend-il en charge une fenêtre de contexte de 1M tokens ?

Oui, via la variante claude-opus-4-8[1m]. Vous l'adressez par cet identifiant de modèle lorsque vous avez besoin de la fenêtre de contexte plus large. Notez que la page de documentation officielle des modèles est peut-être encore en train de se mettre à jour et pourrait ne pas encore lister l'entrée 4.8, mais la variante est adressable à l'exécution dès aujourd'hui.

Claude Opus 4.8 bat-il vraiment GPT-5.5 sur tout ?

Non. GPT-5.5 remporte encore le codage terminal agentique sur Terminal-Bench 2.1, avec 78,2 % contre 74,6 % pour Opus 4.8. Opus 4.8 domine les six autres benchmarks publiés, dont SWE-Bench Pro et GDPval-AA, mais si votre workflow est principalement dans le terminal, GPT-5.5 reste le meilleur choix pour cette tâche spécifique.

Comment passer à Opus 4.8 dans Claude Code ?

Définissez votre modèle sur claude-opus-4-8 (utilisez /model claude-opus-4-8 dans Claude Code) et choisissez un niveau d'effort si votre client le propose. Pour la fenêtre de contexte 1M, utilisez claude-opus-4-8[1m]. C'est un changement quasi-trivial sans aucune autre modification de configuration nécessaire pour la plupart des équipes.

Tags

Claude Opus 4.8claude-opus-4-8claude codeanthropicopus 4.8 vs 4.7

Partager cet article

Démarrez Votre Projet

Prêt à construire quelque chose d'extraordinaire ?

Transformons votre vision en réalité. Notre équipe est prête à vous aider à créer un logiciel qui fait la différence.