
Claude Fable 5 vs Opus 4.8 : Faut-il vraiment migrer ? (Mythos-class, benchmarks)
Anthropic a lancé Claude Fable 5 aujourd'hui, le 9 juin 2026. Le modèle obtient 80,3 % sur SWE-Bench Pro, le benchmark de codage agentique où Opus 4.8 plafonne à 69,2 % et GPT-5.5 traîne à 58,6 %. Ce n'est pas un artefact statistique. Et il y a un détail important : Fable 5 est la version publique et sécurisée d'une nouvelle gamme appelée "Mythos-class", avec un modèle jumeau baptisé Claude Mythos 5 réservé à un programme d'accès restreint. Voici ce qui a changé, ce que coûte une vraie tâche à $10/$50 par million de tokens, et si vous devriez réellement quitter Opus 4.8.
Réponse rapide
- Fable 5 obtient 80,3 % sur SWE-Bench Pro contre 69,2 % pour Opus 4.8 et 58,6 % pour GPT-5.5.
- Tarif : $10 en entrée / $50 en sortie par million de tokens, moins de la moitié de Mythos Preview.
- Fable 5 bascule automatiquement sur Opus 4.8 pour les requêtes à haut risque cyber/bio/chimie (moins de 5 % des sessions).
- Gratuit sur les plans Pro/Max/Team/Enterprise jusqu'au 22 juin 2026 ; les crédits d'utilisation s'appliquent à partir du 23 juin.
Ce qui a réellement été lancé : Fable 5, Mythos 5 et la gamme "Mythos-class"
Mythos-class est le nouveau palier de capacité maximale d'Anthropic, et il se décline en deux modèles. Claude Fable 5 est la version publique et sécurisée que vous pouvez appeler dès aujourd'hui. Claude Mythos 5 est le même modèle frontier avec les garde-fous retirés, réservé à un accès filtré. Même cerveau, deux postures de diffusion.
Cette séparation est l'essentiel à retenir. D'après l'annonce officielle d'Anthropic, Mythos 5 conserve la pleine capacité frontier, y compris des compétences offensives en cybersécurité qui pourraient causer de réels dommages, ce qui explique pourquoi Anthropic ne le met pas à la disposition de tous. Fable 5 prend ce même modèle et l'enveloppe de classificateurs qui détectent les requêtes à haut risque et les redirigent silencieusement vers Opus 4.8.
Autrement dit, quand vous appelez Fable 5, vous obtenez le raisonnement Mythos-class sur tout ce qui n'est pas dangereux, et un modèle de repli plus sûr sur la petite tranche qui l'est. CNBC a résumé la chose en disant qu'Anthropic sort un "AI de type Mythos pour le grand public", ce qui est exact, mais la mécanique précise compte plus que le titre.
Fable 5 et Mythos 5 sont le même modèle frontier découpé en deux : l'un disponible aujourd'hui, l'autre conservé par Anthropic. Si vous ne deviez retenir qu'une chose sur le nommage, c'est celle-là. Mythos-class est le palier ; Fable et Mythos sont les deux portes d'entrée.
Ce qui change par rapport à la gamme Opus 4.x
Sur tous les benchmarks de codage et de raisonnement publiés par Anthropic, Fable 5 dépasse Opus 4.8 non pas d'un cheveu mais de marges à deux chiffres. SWE-Bench Pro passe de 69,2 % à 80,3 %. FrontierCode Diamond grimpe de 13,4 à 29,3. Le tarif a baissé, et le modèle intègre un nouveau curseur d'effort de raisonnement. C'est une vraie progression frontier par rapport à la gamme Opus 4.x, pas une mise à jour mineure.

Le tableau des 13 benchmarks ci-dessus donne la vue d'ensemble. Voici la sélection des chiffres clés contre les trois modèles que la plupart des équipes comparent :
| Benchmark | Claude Fable 5 | Claude Opus 4.8 | GPT-5.5 |
|---|---|---|---|
| SWE-Bench Pro (codage agentique) | 80,3 % | 69,2 % | 58,6 % |
| FrontierCode Diamond (codage le plus difficile) | 29,3 | 13,4 | 5,7 |
| Terminal-Bench 2.1 (shell agentique) | 88,0 % | n/a | n/a |
| GPQA-AA (raisonnement universitaire, Elo) | 1932 | n/a | n/a |
| ExploitBench | 78,0 % | n/a | n/a |
Le point de comparaison central ici est Claude Opus 4.8, le modèle que Fable 5 remplace en tête de gamme, et le même modèle sur lequel Fable 5 bascule pour les requêtes à haut risque. Si vous avez suivi la gamme Opus 4.x sur les deux dernières versions, le schéma était des gains progressifs. Fable 5 casse ce schéma.
Deux réserves avant de prendre le tableau pour argent comptant. D'abord, ce sont les évaluations publiées par Anthropic eux-mêmes, pas un test indépendant. Ensuite, le curseur d'effort de raisonnement signifie qu'un seul chiffre de benchmark cache en réalité une courbe de coût. On y revient dans la section tarification, parce que ça change le calcul.
Les benchmarks qui comptent pour les développeurs
Quatre chiffres portent le poids pratique : SWE-Bench Pro 80,3 %, FrontierCode Diamond 29,3, Terminal-Bench 2.1 88,0 %, et GPQA-AA 1932 Elo. Ensemble, ils couvrent le travail réel sur des dépôts, les problèmes de codage les plus complexes, les tâches shell agentiques, et le raisonnement de niveau universitaire. Si votre charge de travail touche à l'un de ces domaines, c'est la section qui vous dit si le chiffre s'applique à votre situation.
Le graphique principal en haut de cet article en est la preuve : SWE-Bench Pro 80,3 vs 69,2 vs 58,6, et FrontierCode 29,3 vs 13,4 vs 5,7. Mais que mesurent-ils concrètement ?
- SWE-Bench Pro teste si un modèle est capable de soumettre une vraie pull request à un vrai dépôt : cloner, comprendre, patcher, faire passer les tests. Fable 5 réussit 8 fois sur 10. C'est le proxy le plus proche de "est-ce qu'il peut faire mon vrai boulot".
- Terminal-Bench 2.1 évalue les tâches shell agentiques : lancer des commandes, lire les sorties, se remettre des erreurs. 88,0 % importe si vous construisez des agents de codage IA qui vivent dans un terminal.
- FrontierCode Diamond correspond au palier le plus difficile des problèmes de codage, là où la plupart des modèles sont à un chiffre. 29,3 reste faible en absolu mais dépasse plus du double les 13,4 d'Opus 4.8.
- GPQA-AA mesure le raisonnement scientifique de niveau universitaire, exprimé en Elo. 1932 signale un raisonnement multi-étapes solide, au-delà du code.
Dans nos workflows Claude Code sur la gamme Opus 4.x, le plafond récurrent était les tâches agentiques à long horizon : le modèle perdait le fil à mi-chemin d'un changement multi-fichiers. Les chiffres Terminal-Bench et SWE-Bench Pro de Fable 5 suggèrent que ce plafond a bougé. Si c'est vrai pour votre dépôt, seul votre test propre peut le confirmer, mais les chiffres publiés sont le bon type de signal à prendre en compte.
Cas concrets : ce que Fable 5 fait que les modèles précédents ne pouvaient pas
Anthropic a publié trois exemples précis qui illustrent la classe de problèmes que Fable 5 peut maintenant traiter : une migration de codebase Stripe ramenée de plusieurs mois à une journée, un jeu vidéo terminé par vision seule, et un gain de performance 3× grâce à l'auto-validation. Chacun pointe vers une capacité hors de portée des modèles précédents. Les trois viennent d'Anthropic ; on cite leur annonce, pas un test interne.
Voici ce que chaque exemple démontre :
-
Migration Ruby Stripe. Anthropic rapporte que Fable 5 a comprimé une migration de codebase Ruby de deux mois environ à environ une journée. Stripe a ramené une migration Ruby de deux mois à une seule journée, et c'est la classe de refactoring long-horizon que ce modèle change. C'est le type de travail qui nécessitait jusqu'ici une équipe humaine tenant toute la base de code en tête.
-
Pokémon FireRed par vision seule. D'après Anthropic, Fable 5 a terminé Pokémon FireRed en utilisant uniquement la vision, là où les modèles précédents nécessitaient des harnais personnalisés complexes pour injecter l'état du jeu sous forme de texte. C'est un saut en raisonnement spatial et visuel : le modèle lit l'écran et agit, sans scaffolding.
-
Slay the Spire, ×3. À effort de raisonnement maximal, Anthropic indique que Fable 5 auto-valide ses propres décisions et a atteint des performances 3× meilleures grâce à la mémoire persistante. La leçon n'est pas le jeu lui-même ; c'est que le modèle peut vérifier son propre travail sur un long horizon de planification et s'améliorer en conséquence.
Rien de tout cela ne remplace un test sur votre charge de travail réelle. Mais ces exemples correspondent proprement aux sauts de benchmarks dans le tableau ci-dessus : codage à long horizon (SWE-Bench Pro), raisonnement spatial (vision), et auto-validation (le curseur d'effort de raisonnement). Les victoires qualitatives et quantitatives racontent la même histoire.
Tarification et coût réel par tâche
Fable 5 coûte $10 par million de tokens en entrée et $50 par million de tokens en sortie. Anthropic présente cela comme "moins de la moitié du prix de Claude Mythos Preview". C'est aussi environ 2× Opus 4.8 par token. Les deux affirmations sont vraies. Le piège, c'est que le prix par token est la mauvaise unité. Ce que vous payez réellement, c'est une tâche terminée, et c'est là que le calcul de Fable 5 devient intéressant.

L'effort de raisonnement est un curseur que vous définissez par requête. Un effort faible signifie moins de tokens de raisonnement internes, une réponse moins chère et plus rapide ; un effort maximal signifie que le modèle réfléchit plus longtemps, dépense plus de tokens en sortie, et obtient de meilleurs scores. Le graphique ci-dessus montre Fable 5 progressant de ~11 % à ~31 % sur FrontierCode selon l'effort, tandis qu'Opus 4.8 plafonne à ~13 % et GPT-5.5 stagne autour de 5-6 %. Le coût par tâche n'est donc pas un chiffre fixe ; c'est une courbe dont vous choisissez un point.
Voici un exemple concret calculé à partir des tarifs publiés de $10/$50. C'est de l'arithmétique sur les prix officiels d'Anthropic, pas un résultat benchmarké.
Prenez un appel agentique avec 50 000 tokens en entrée et 15 000 tokens en sortie à effort élevé :
Entrée : 50 000 / 1 000 000 × $10 = $0,50
Sortie : 15 000 / 1 000 000 × $50 = $0,75
Par appel : $1,25Une vraie tâche agentique enchaîne de nombreux appels : lire le dépôt, planifier, modifier, lancer les tests, corriger, recommencer. Supposez que la boucle tourne 12 fois avec ce profil : environ $15 pour la tâche terminée. À effort de raisonnement maximal avec un contexte plus lourd, la courbe de coût d'Anthropic place les tâches FrontierCode difficiles plutôt dans les $20 par tâche. Lancez la même tâche sur GPT-5.5 et vous payez moins par token. Mais s'il ne peut pas la terminer quel que soit l'effort, votre coût-par-tâche-terminée est infini. Fable 5 coûte plus par token que GPT-5.5, et gagne quand même sur le coût par tâche terminée, parce qu'il accomplit un travail que GPT-5.5 ne peut pas faire.
Voici un appel minimal. L'annonce d'Anthropic donne claude-fable-5 comme identifiant de modèle ; vérifiez la chaîne exacte versionnée dans la documentation de l'API Anthropic avant de déployer, car les alias datés peuvent différer :
import anthropic
client = anthropic.Anthropic()
message = client.messages.create(
model="claude-fable-5", # verify exact dated id in API docs
max_tokens=4096,
thinking={"type": "enabled", "budget_tokens": 8000}, # reasoning effort
messages=[
{"role": "user", "content": "Migrate this module from Ruby 2.7 to 3.3 and run the tests."}
],
)
print(message.content)La thèse économique en une ligne : vous payez plus par token que GPT-5.5, mais vous terminez des tâches que GPT-5.5 ne peut pas accomplir à aucun prix. Pour un travail volumique à faibles enjeux, le calcul favorise un modèle moins cher. Pour le codage agentique difficile, il favorise Fable 5.
Le mécanisme de repli : pourquoi Fable bascule sur Opus 4.8
Fable 5 fait tourner des classificateurs sur chaque requête. Quand il détecte une requête à haut risque (cyber offensif, bio, chimie, ou tentatives de distillation du modèle), il bascule sur Opus 4.8 plutôt que de répondre avec la pleine capacité Mythos-class. Anthropic indique que ce repli se déclenche sur moins de 5 % des sessions, donc la plupart des utilisateurs ne le rencontreront jamais. L'objectif est de garder la capacité dangereuse derrière la barrière tout en laissant le travail quotidien intact.

Le chiffre qui compte davantage est le taux de succès des attaques : à quelle fréquence un attaquant automatisé parvient-il à jailbreaker le modèle pour lui faire faire quelque chose qu'il ne devrait pas. Plus bas est mieux. Les résultats du red-team d'Anthropic montrent une chute marquée au fil des versions : Opus 4.6 à 83,2 %, Opus 4.7 à 72,7 %, Opus 4.8 à 56,6 %, jusqu'à Fable 5 à 5,4 %. Sous red-teaming automatisé, les attaques ont réussi contre Fable 5 dans seulement 5,4 % des cas, contre 56,6 % pour Opus 4.8.
Pourquoi s'en préoccuper ? Si vous déployez un agent avec accès aux outils (shell, système de fichiers, réseau), un jailbreak n'est pas une mauvaise réponse dans un chat, c'est un modèle qui exécute de vraies commandes qu'un attaquant a orientées. Un taux de succès d'attaque de 5,4 % signifie qu'il est environ dix fois plus difficile à weaponiser qu'Opus 4.8. La couverture d'IT Pro a mis le mécanisme de repli en avant pour exactement cette raison : c'est la fonctionnalité qui rend un modèle frontier assez sûr pour le grand public.
La contrepartie, c'est la latence. Si votre workflow touche légitimement aux outils de sécurité, le repli peut se déclencher en pleine tâche et changer de modèle à la volée, quelque chose à anticiper.
Claude Mythos 5 et la question du double usage
Claude Mythos 5 est le modèle jumeau gated, le même modèle sans le mécanisme de repli de sécurité. Il conserve la capacité cyber offensive que Fable 5 bloque, ce qui explique précisément pourquoi Anthropic ne le diffuse pas publiquement. L'accès passe par Project Glasswing, un programme contrôlé pour les défenseurs et chercheurs qui ont besoin de la pleine capacité. Même modèle, deux postures de diffusion : l'une ouverte, l'autre filtrée.

Le graphique rend la séparation visible. Sur les évaluations cyber offensives (Firefox, OSS-Fuzz, CyberGym, CyScenarioBench), Mythos 5 obtient 88,4, 24,0, 83,8 et 38,7. Fable 5 retourne un plat 0,0 sur les quatre. Sur les évaluations cyber offensives, Mythos 5 atteint jusqu'à 88,4 là où Fable 5 retourne un plat 0,0 : la séparation par les garde-fous, rendue visible.
Ce zéro n'est pas un écart de capacité. C'est le mécanisme de repli qui se déclenche à chaque fois, bloquant la requête avant que le modèle Mythos-class ne réponde. TechCrunch a noté le timing : Anthropic a lancé cela quelques jours après avoir averti que l'IA devient trop dangereuse pour une diffusion ouverte. La séparation Fable/Mythos est la réponse politique à cet avertissement : publier la capacité, mettre le danger sous clé.
Pour la plupart des développeurs, Mythos 5 n'est pas pertinent. Vous ne vous qualifierez probablement pas pour Project Glasswing et vous n'en avez pas besoin. Ce qui compte, c'est de savoir que le modèle que vous appelez est délibérément limité sur une bande étroite de tâches, par conception.
Verdict : faut-il migrer ?
Passez à Fable 5 pour le codage agentique difficile, les tâches multi-étapes à long horizon, et le raisonnement visuel ou spatial, partout où terminer la tâche vaut plus qu'économiser quelques centimes par token. Restez sur Opus 4.8 pour un travail volumique sensible au coût, ou pour tout ce qui déclenche le repli de toute façon. C'est tout le cadre. Le reste consiste à faire correspondre votre charge de travail au bon côté.
Quand Fable 5 l'emporte :
- Codage agentique difficile où Opus 4.8 bloque ; l'écart SWE-Bench Pro est réel
- Tâches à long horizon (refactoring multi-fichiers, migrations) où l'auto-validation paie
- Charges de travail visuelle et spatiale
- Tout travail où une tâche terminée vaut plus que la prime en tokens
Quand Opus 4.8 tient bon :
- Travail volumique à forte sensibilité au coût, où le prix par token domine
- Charges cyber/bio/chimie, où Fable 5 bascule vers Opus 4.8 de toute façon, autant l'appeler directement
- Flux sensibles à la latence qui ne peuvent pas tolérer un changement de modèle en cours de tâche
| Cas d'usage | Modèle recommandé |
|---|---|
| Codage agentique difficile / migrations | Claude Fable 5 |
| Vision / raisonnement spatial | Claude Fable 5 |
| Classification volumique bon marché | Claude Opus 4.8 |
| Outils sécurité / red-team | Claude Opus 4.8 (direct) |
Sur la disponibilité : Fable 5 est gratuit sur les plans Pro/Max/Team/Enterprise jusqu'au 22 juin 2026, les crédits d'utilisation s'appliquant à partir du 23 juin. Il est disponible en général sur l'API Anthropic, AWS Bedrock, GitHub Copilot selon le changelog GitHub, et Harvey. Vous pouvez donc tester la migration dans votre éditeur aujourd'hui sans toucher à votre facturation.
À propos de l'auteur
Mert Batur Gurbuz est co-fondateur de Techsy.io, où l'équipe déploie des agents IA, des systèmes d'automatisation et des pipelines voice/SDR pour des clients B2B. Il étudie à l'Université de Birmingham et écrit sur la stack d'outillage LLM que l'équipe Techsy utilise réellement en production. Retrouvez-le sur LinkedIn.
Co-Fondateur, Techsy.io · Université de Birmingham
Questions fréquentes
Qu'est-ce que Claude Fable 5 ?
Claude Fable 5 est le premier modèle Mythos-class d'Anthropic disponible publiquement, lancé le 9 juin 2026. Il obtient 80,3 % sur SWE-Bench Pro et fait tourner des classificateurs de sécurité qui basculent sur Opus 4.8 pour les requêtes à haut risque. Il coûte $10 en entrée / $50 en sortie par million de tokens.
Quelle est la différence entre Fable 5 et Mythos 5 ?
Ce sont le même modèle frontier avec deux postures de diffusion différentes. Fable 5 est public et sécurisé ; il bascule sur Opus 4.8 pour les requêtes dangereuses. Mythos 5 est la version à pleine capacité, accessible uniquement via le programme Project Glasswing d'Anthropic pour les défenseurs et chercheurs agréés.
Claude Fable 5 est-il vraiment meilleur qu'Opus 4.8 ?
Oui pour le codage agentique difficile, la vision et le raisonnement spatial : Fable 5 atteint 80,3 % sur SWE-Bench Pro contre 69,2 % pour Opus 4.8. Mais Opus 4.8 reste compétitif pour un travail volumique sensible au coût, et Fable 5 bascule vers Opus 4.8 pour les sujets cyber/bio/chimie à haut risque de toute façon. "Meilleur" dépend de votre charge de travail.
Combien coûte Claude Fable 5 ?
Claude Fable 5 coûte $10 par million de tokens en entrée et $50 par million de tokens en sortie. Anthropic le présente comme "moins de la moitié du prix de Mythos Preview". C'est environ 2× Opus 4.8 par token, mais l'argument de valeur se fait par tâche terminée, Fable 5 accomplissant un travail que les modèles moins chers ne peuvent pas.
Qu'est-ce qu'un modèle "Mythos-class" ?
Mythos-class est le nouveau palier de capacité maximale d'Anthropic, lancé avec Fable 5 et Mythos 5. Il représente un saut frontier par rapport à la gamme Opus 4.x sur les benchmarks de codage et de raisonnement. Fable 5 et Mythos 5 sont deux versions du même modèle Mythos-class : l'une publique et sécurisée, l'autre filtrée.
Pourquoi Fable 5 bascule-t-il sur Opus 4.8 ?
Fable 5 fait tourner des classificateurs qui détectent les requêtes à haut risque (cyber offensif, bio, chimie, ou distillation de modèle) et les route vers Opus 4.8 plutôt que de répondre avec la pleine capacité Mythos-class. Cela se déclenche sur moins de 5 % des sessions. Ce mécanisme a réduit le taux de succès des attaques adversariales de 56,6 % (Opus 4.8) à 5,4 %.
Puis-je accéder à Claude Mythos 5 ?
Probablement pas. Mythos 5 est réservé au programme Project Glasswing, le programme d'accès filtré d'Anthropic pour les défenseurs et chercheurs en sécurité qui ont besoin de la pleine capacité cyber offensive que Fable 5 bloque. La plupart des développeurs ne seront pas éligibles et n'en ont pas besoin, Fable 5 couvrant le travail agentique et de codage courant.
Où puis-je utiliser Claude Fable 5 ?
Claude Fable 5 est disponible en général sur l'API Anthropic, AWS Bedrock, GitHub Copilot et Harvey. Il est gratuit sur les plans Pro, Max, Team et Enterprise jusqu'au 22 juin 2026 ; les crédits d'utilisation s'appliquent à partir du 23 juin. Vous pouvez le tester dans votre éditeur ou via l'API dès aujourd'hui.
Conclusion
Claude Fable 5 est un vrai pas en avant par rapport à Opus 4.8 : 80,3 % vs 69,2 % sur SWE-Bench Pro, un score FrontierCode doublé, et un taux de succès d'attaque de 5,4 % qui le rend bien plus sûr à déployer avec des outils. Passez-y pour le codage agentique difficile, les tâches à long horizon et le travail de vision. Restez sur Opus 4.8 pour un volume sensible au coût ou tout ce qui déclenche le repli de toute façon. C'est gratuit jusqu'au 22 juin, vous pouvez donc tester la migration avant que cela ne vous coûte quoi que ce soit. L'équipe Techsy construit des agents de production exactement sur cette stack, donc contactez-nous si vous avez besoin d'un coup de main.