ai-machine-learning

Test Claude Fable 5.1 : on l'a mesuré face à Fable 5 et Opus 5

Écrit par Mert Batur
Sep 2, 2026
10 lecture
Test Claude Fable 5.1 : on l'a mesuré face à Fable 5 et Opus 5

Test Claude Fable 5.1 : on l'a mesuré face à Fable 5 et Opus 5

Claude Fable 5.1 est sorti le 2026-09-01 au même tarif $10/$50 que Fable 5, lectures cache à $0.25. On a lancé 14 tâches OpenRouter appariées le lendemain matin à 08:55 UTC. L'économie agentique de 45 % n'était pas sur cette facture : les trois modèles ont passé 14/14, et 5.1 a facturé $0.14693 contre Opus 5 à $0.080725.

L'ID frontier généralement disponible d'Anthropic est claude-fable-5-1, GA 2026-09-01, $10/$50 par million de tokens, cache read $0.25. Mythos 5.1, ce sont les mêmes poids avec des garde-fous cyber/bio plus souples, Glasswing uniquement. Coupure de connaissances juin 2026. Thinking toujours actif.

Claude Fable 5.1 vs Fable 5 vs Opus 5 : le tableau de bascule

Reste sur Opus 5 pour ce jeu de 14 tâches ; Fable 5.1 a égalé la précision et a coûté 1.11× Fable 5.

On a appelé anthropic/claude-fable-5.1 le matin après la GA. La fiche tarifaire n'a pas bougé : $10/$50, identique à Fable 5. Claude Opus 5 est à $5/$25. Le cache read est le seul changement de prix catalogue ($0.25 vs $1.00), et il ne s'est pas déclenché ici.

Opus 5 est 45 % moins cher que Fable 5.1 sur ce jeu de 14 tâches parce que le tarif catalogue est $5/$25 vs $10/$50, pas parce qu'il a consommé moins de tokens.

Fable 5.1Fable 5Opus 5
Tarif $ entrée/sortie$10/$50$10/$50$5/$25
Cache read$0.25 / MTok$1.00 / MTokn/a
Effort par défautHigh dans Claude Code ; Medium sur claude.ai / Coworkn/aHigh
Titre vendeurTerminal-Bench-Science 52.6%24.7%29.0%
Facture (notre mesure)$0.14693, 14/14$0.13285, 14/14$0.080725, 14/14
Basculeragents lourds en cacheappels courts sans cachesingle-shot borné

Mêmes poids, deux portes, et l'une ne répondra pas

Mythos 5.1, ce sont les mêmes poids avec des garde-fous cyber/bio plus souples, et il n'est pas sur OpenRouter.

La phrase de lancement d'Anthropic est littérale : « Claude Fable 5.1 and Claude Mythos 5.1 are the same model, but with different levels of safeguards. » Fable est GA (claude-fable-5-1, Bedrock anthropic.claude-fable-5-1). Mythos est claude-mythos-5-1 derrière Project Glasswing / CVP / LSVP, pour l'instant un ensemble d'organisations US. Contexte 1M, sortie max 128k, coupure juin 2026 contre janvier 2026 pour Fable 5. Notre expérience a coûté $0.53795. Mythos n'a pas été appelé.

python
# OpenRouter slugs we actually sent on 2026-09-02
MODELS = [
    "anthropic/claude-fable-5.1",
    "anthropic/claude-fable-5",
    "anthropic/claude-opus-5",
    # claude-mythos-5-1: not listed / Glasswing only
]

Quels benchmarks Claude Fable 5.1 ont vraiment bougé ?

Terminal-Bench-Science 0.1 est le saut : 52.6% sur Fable 5.1 contre 24.7% sur Fable 5.

Fable 5 était à 24.7% et Opus 5 à 29.0%. Ce saut explique pourquoi les boucles de codage agentique comptent plus que nos 14 appels courts.

BenchFable 5.1Fable 5Opus 5GPT-5.6 Sol
Terminal-Bench-Science 0.152.6%24.7%29.0%22.4%
Terminal-Bench 4.055.8% (Mythos 5.1 : 60.9%)42.0%52.3%37.3%
GDPval-AA v21853172318241711
OSWorld 2.0 partial / strict77.9% / 41.7%72.9% / 36.1%75.4% / 39.6%n/a
HLE sans outils / avec outils60.9% / 65.0%57.8% / 63.8%56.6% / 63.6%n/a
AutomationBench31.4%17.1%26.9%19.6%
CursorBench 3.2.073.4%70.5%70.0%67.2%

Source : annonce Anthropic, 2026-09-01.

SourceConstatPérimètre
Artificial Analysis, 2026-09-01Intelligence Index 66 à maxFable 5 max 62 ; Opus 5 max 63
Artificial Analysis$3.76 / tâche vs Fable 5 $3.14 (+20 %)~1,7× de sortie ; ~$5.16 sans la baisse ; xhigh 65 à $2.72
Snorkel, 2026-09-0158 % de tokens en moins, 36 % plus rapidevs succès Opus 5 uniquement ; 18 / 5 / 2 / 2 ; pass@1 61,5 % ; build/dep 18 % vs 67 %

Le 58 % / 36 % de Snorkel compare à Opus 5 sur les runs réussis seulement, pas à Fable 5. Opus a quand même résolu trois tâches de plus (18 les deux / 5 Opus seul / 2 Fable seul).

  1. Terminal-Bench-Science SE ±3,5-4,5 pts. Le leaderboard public (3 essais/tâche, runner Claude Code) rapporte Opus 5 à 30,0 % et Fable 5 à 21,4 % ; le setup d'Anthropic reproduit 29.0% et 24.7%, tous deux dans le bruit.
  2. OSWorld 2.0 est la release de tâches des auteurs d'août 2026 ; Fable 5 et Opus 5 ont été relancés dans les mêmes conditions. Pas comparable aux anciens chiffres OSWorld.
  3. Les garde-fous de production étaient actifs. Les interventions ont compté zéro sur OSWorld (les deux Fable) et sur AutomationBench (Fable 5). D'autres tâches cyber sont retombées sur Opus 4.8 ; la biologie sur Opus 5. Ça sous-estime probablement la capacité brute.

L'économie de 25 % Claude Fable 5.1 est-elle sur ta facture ?

La ligne cache-read est 75 % moins chère ; le follow-up court entier n'était que 21 % moins cher.

Le post de lancement d'Anthropic estime ~25 % en typique et ~45 % en agentique vs Fable 5. Les deux exigent que les lectures cache dominent, et que les tokens de sortie n'explosent pas. La grille docs : cache write $12.50 / $20, sortie $50, cache read $1.00 → $0.25 / MTok. Les modèles de coût de charge disent si cette baisse survit au coup de rabot sur la facture tokens ailleurs.

ScénarioLabelFable 5Fable 5.1Delta
Ligne A : 20 tours / ~1M (9,5M lectures cache, writes $12.50, sortie $50)identité tarif catalogue, pas notre mesure$72.00 ($9.50 cache)$64.88 ($2.38 cache)-9,9 %
Ligne B : tâche Intelligence IndexArtificial Analysis, 2026-09-01$3.14$3.76 (~$5.16 sans la baisse)+20 % à max (~1,7× sortie)
Ligne C : préfixe 1,165 tokens, tour 2Techsy OpenRouter, 2026-09-02$0.005086$0.00402125tour entier 21 % moins cher
Ligne tour 2 (facture, notre mesure)Fable 5.1Fable 5
Tokens d'entrée en cache1,1651,166
Ligne cache-read$0.000291$0.001166
OpenRouter usage.cost$0.00402125$0.005086

La ligne cache-read est 75.0% moins chère ($0.000291 vs $0.001166). L'économie sur le tour entier plafonne à 21 % parce que la sortie facture toujours à $50/M. Mets la ligne cache à l'échelle de 40 relectures × 200 000 tokens : $2.00 sur 5.1 vs $8.00 sur 5.

AY Automate a demandé « Is Claude Fable 5.1 more expensive than Fable 5? » le 2026-09-01 et a répondu « No. » Le tarif catalogue reste $10/$50. La facture, elle, non : Artificial Analysis a mesuré +20 % à max, THE DECODER a mis à jour le même jour avec ce +20 %, et nos 14 appels sans cache ont facturé 1.11×.

L'utilisateur HN george_max (item 49525611, 2026-09-01) a dit « just cache reads » et « 15% more », ce qui colle à AA à effort max. Les fenêtres d'abonnement de 5 heures ne facturent pas les lectures cache comme l'API.

Un quiz, pas un bench : la réponse cache tour 2 de Fable 5 a utilisé $2.00 / $2.50 (tarifs 5.1) sur un prompt qui disait « on this model ».

Ce que notre mesure OpenRouter a montré sur Claude Fable 5.1

Les trois modèles ont passé 14/14 à effort=low ; Opus 5 était 45 % moins cher que Fable 5.1.

On a benchmarké 14 prompts. Précision à égalité ; Opus 5 a quand même gagné sur $5/$25 vs $10/$50.

  1. Quand : 2026-09-02, 08:55 UTC, chat-completions OpenRouter. Tarifs publics sur la page modèle Fable 5.1.
  2. Quoi : anthropic/claude-fable-5.1 vs anthropic/claude-fable-5 vs anthropic/claude-opus-5.
  3. Comment : reasoning.effort=low sauf trois appels coding High sur Fable 5.1. Pas de temperature (5.1 refuse le sampling hors défaut).
  4. Correcteurs : JSON-schema, match numérique exact, unit tests exécutés. Artefacts : fable_bench.py, benchmark-raw.json, benchmark-aggregate.json. On a testé les trois slugs de notre benchmark : 49 appels, $0.53795.
Métrique (14 appels, effort=low)Fable 5.1Fable 5Opus 5
Tâches réussies14/1414/1414/14
Latence médiane5.647 s5.383 s4.797 s
Tokens de completion médians9490103
Tokens de reasoning médians0823
Total tokens de completion2,5472,2712,843
Total tokens de reasoning0253380
Coût total$0.14693$0.13285$0.080725

Le coding a passé 6/6 chacun à low.

Tâche (2 essais)Sortie Fable 5.1Sortie Fable 5Sortie Opus 5
merge_intervals175, 16896, 96155, 155
semver_satisfies414, 411405, 401493, 487
lru_ttl_cache387, 418395, 339469, 459
Latence médiane coding6,523 s5,389 s6,316 s
Coût total coding$0.11095$0.09878$0.06154

Traite le « more concise in plans and summaries » d'Anthropic comme une affirmation sur les traces d'agents, pas sur les dumps de fonctions en single-shot. Fable 5.1 a dépensé ~175 tokens sur merge_intervals là où Fable 5 en a dépensé 96, les deux en passant.

Ce que ça ne mesure pas :

  • Mythos 5.1 (pas appelable depuis ce compte).
  • Agents multi-heures, Terminal-Bench, SWE-bench, computer use.
  • L'effort par défaut (on a épinglé low sauf round 3).
  • Les écritures cache à TTL 5 minutes vs 1 heure.
  • Les refus, le repli vers Opus, le batching de boucles d'outils.

Quelles trois requêtes renvoient 400 sur Fable 5.1 ?

Un tool_choice forcé de type any ou tool renvoie HTTP 400 sur claude-fable-5-1.

What's new in Fable 5.1 nomme l'erreur : tool_choice: type "tool" and "any" are not supported for this model. Le prefill du tour assistant est aussi en 400. Un temperature / top_p / top_k hors défaut est aussi en 400 ; on n'a envoyé aucune temperature pour cette raison. Les blocs thinking sont liés au modèle producteur (thinking-binding-controls-2026-08-01) : 5.1 lit les blocs antérieurs, les modèles antérieurs ne peuvent pas lire ceux de 5.1, et un fallback de routeur les droppe. Éditer quoi que ce soit avant un bloc thinking 5.1 erreur ou le droppe pour les comptes créés le/après 2026-08-31. Mythos 5.1 saute cette vérif de préfixe.

python
# HTTP 400 invalid_request_error on anthropic/claude-fable-5.1
payload = {
    "model": "anthropic/claude-fable-5.1",
    "messages": [{"role": "user", "content": "Look up the cache rate."}],
    "tools": [{"type": "function", "function": {"name": "lookup"}}],
    "tool_choice": {"type": "tool", "name": "lookup"},  # type "any" 400s too
}
# error: tool_choice: type "tool" and "any" are not supported for this model.
  1. Mets tool_choice à auto et strict: true sur le schéma d'outil, ou passe aux structured outputs.
  2. Garde l'historique en append-only ; n'édite jamais un préfixe devant un bloc thinking 5.1.
  3. Droppe les blocs thinking quand tu retombes sur un modèle antérieur.
  4. Omets temperature / top_p / top_k, et ne prefills pas le tour assistant.

Pourquoi Claude Code met-il Fable 5.1 en High par défaut ?

Claude Code met Fable 5.1 en High par défaut ; sur lru_ttl_cache ça a multiplié par 4 une tâche qui passait déjà à Low.

L'annonce d'Anthropic fixe High dans Claude Code et Medium sur claude.ai / Cowork. Cinq niveaux d'effort : low / medium / high / xhigh / max. Thinking est toujours actif ; thinking: disabled est en 400. Le Help Center exige Claude Code 2.1.250 ou plus récent.

TâcheLow (out / reason / coût)High (out / reason / coût / latence)
merge_intervals172 / 0 / $0.010175 / 0 / $0.01024 / 4,86 s
semver_satisfies413 / 0 / $0.023401 / 0 / $0.02238 / 7,60 s
lru_ttl_cache403 / 0 / $0.0221,713 / 1,150 / $0.08798 / 22.07 s

merge_intervals et semver_satisfies ressemblaient à Low. lru_ttl_cache non. High a dépensé 4,25× les tokens de completion (1,713 vs 403), a ajouté 1,150 tokens de reasoning, a pris 22.07 s vs ~7 s, et a coûté une facture 4.0× ($0.08798 vs $0.022) pour des tests qu'on avait déjà. Épingle effort=low (ou Medium sur claude.ai) pour les fonctions bornées.

Simon Willison (2026-09-01, pas notre pelican) : l'effort ne peut pas être off ; max a fait 33× la sortie de low sur un prompt.

Tu restes sur Fable 5, sur Opus 5, ou tu changes ?

Reste sur Opus 5 pour le travail single-shot borné ; bascule les agents lourds en cache vers Fable 5.1.

Les docs disent de commencer par Opus 5 et d'aller chercher Fable 5.1 quand les évals High-effort restent en dessous. Notre éval, c'est la mesure 14/14 : Opus 5 à $0.0807 vs $0.1469 (45 % moins cher). Ne passe pas Fable 5 à 5.1 pour des appels courts sans cache : 14/14 des deux côtés, 5.1 a coûté 1.11× plus ici.

RègleInverse siFacture (notre mesure)
Reste sur Opus 5 pour le single-shot bornéles évals High-effort ratent encore les longues sessions d'agents$0.080725, 14/14, 45 % moins cher que $0.14693
Bascule les agents lourds en cache vers Fable 5.1la session ne relit jamais un gros préfixeligne cache-read 75.0% moins chère ($0.000291 vs $0.001166)
Ne laisse pas Claude Code sur High par défaut pour des tâches qui passent déjà à Lowle job est une boucle de classe Terminal-Bench-Science4.0× sur lru_ttl_cache ($0.08798 vs $0.022)
Ne passe pas Fable 5 → 5.1 pour des appels courts sans cachetu as besoin du saut Science ou du cache read $0.251.11× ($0.14693 vs $0.13285), 14/14 des deux

Fable 5.1 a facturé $0.14693 (1.11×) sur du 14/14 sans cache ; le gain, c'est la ligne cache-read. Fable 5 a facturé $0.13285 jusqu'à ce qu'un préfixe de 1,165 tokens se relise. Opus 5 a facturé $0.080725, 45 % moins cher, avec plus de tokens (2,843 vs 2,547).

Le travail single-shot borné reste sur Opus 5. Les agents lourds en cache passent à Fable 5.1 pour la ligne cache-read $0.25, avec l'effort épinglé à Low quand les tests passent déjà. Les appels Fable 5 courts sans cache restent où ils sont.

Questions fréquemment posées

Quel est l'API ID de Claude Fable 5.1 ?

claude-fable-5-1 sur l'API Anthropic, anthropic.claude-fable-5-1 sur Bedrock, et anthropic/claude-fable-5.1 sur OpenRouter. Vertex, Foundry et Claude Platform gardent claude-fable-5-1. Mythos est claude-mythos-5-1, Glasswing uniquement ; ce n'est pas un modèle OpenRouter que tu peux taper, et on ne l'a pas appelé le 2026-09-02.

La baisse cache-read s'applique-t-elle aux quotas Claude Code Max ?

Non. La baisse de 75 % est un prix API de cache-read ($1.00 → $0.25 / MTok). Les fenêtres d'abonnement de 5 heures ne facturent pas les lectures cache de cette façon, donc l'économie typique de 25 % ne s'étend pas aux quotas Max. r/ClaudeCode (2026-09-01) a signalé avoir brûlé la fenêtre de 5 heures en 20 minutes après l'arrivée du défaut High.

Quelle version de Claude Code faut-il pour Fable 5.1 ?

2.1.250 ou plus récent, d'après le Help Center au 2026-09-01. Fable 5 demandait 2.1.170+. Les builds plus anciens ratent le nouvel ID, le défaut High qui a multiplié par 4.0× notre tâche LRU, et le sélecteur d'effort que 5.1 attend. Mets à jour avant de pointer du trafic dessus.

Fable 6 est-il le prochain ?

5.1 est la point-release que ce post prédisait. Fable 6 reste non annoncé. Les threads Polymarket qui demandaient une date 5.1 sont périmés : la GA était le 2026-09-01, et l'annonce ne donne aucun calendrier Fable 6. Ne bloque pas un switch 5 vs 5.1 en l'attendant.

Claude Fable 5.1 est-il un Covered Model ?

Oui. Rétention de données 30 jours. Pas disponible sous zero data retention sauf autorisation expresse. Les Enterprise Frontier Safeguards (stockage cloud client) arrivent plus tard cet automne ; les clients éligibles peuvent utiliser le ZDR d'ici là. Un watermark statistique sur le texte part sur toutes les plateformes (EU AI Act, modèles après 2026-08-02) ; l'API de détection est en private preview.

Tags

claude-fable-5-1claude-mythos-5-1cache-de-promptsclaude-opus-5openrouter

Partager cet article

Démarrez Votre Projet

Prêt à construire quelque chose d'extraordinaire ?

Transformons votre vision en réalité. Notre équipe est prête à vous aider à créer un logiciel qui fait la différence.