ai-machine-learning

Claude Fable 5.1 Review: Lo medimos frente a Fable 5 y Opus 5

Escrito por Mert Batur
Sep 2, 2026
10 lectura
Claude Fable 5.1 Review: Lo medimos frente a Fable 5 y Opus 5

Claude Fable 5.1 Review: Lo medimos frente a Fable 5 y Opus 5

Claude Fable 5.1 salió el 2026-09-01 al mismo $10/$50 que Fable 5, con lecturas de caché bajadas a $0.25. Al día siguiente, a las 08:55 UTC, corrimos 14 tareas emparejadas en OpenRouter. El ahorro agéntico del 45% no apareció en esa factura: los tres modelos pasaron 14/14, y 5.1 facturó $0.14693 frente a Opus 5 a $0.080725.

El ID frontier de disponibilidad general de Anthropic es claude-fable-5-1, GA 2026-09-01, $10/$50 por millón de tokens, cache read $0.25. Mythos 5.1 son los mismos pesos con salvaguardas distintas (más laxas en cyber/bio), solo Glasswing. Corte de conocimiento jun 2026. Thinking siempre activo.

Claude Fable 5.1 vs Fable 5 vs Opus 5: la tabla de cambio

Quédate en Opus 5 para este set de 14 tareas; Fable 5.1 empató en precisión y costó 1.11× Fable 5.

Llamamos a anthropic/claude-fable-5.1 la mañana después del GA. La ficha de precios no se movió: $10/$50, igual que Fable 5. Claude Opus 5 va a $5/$25. Cache read es el único cambio de lista ($0.25 vs $1.00), y aquí no se disparó.

Opus 5 es un 45% más barato que Fable 5.1 en este set de 14 tareas porque el precio de lista es $5/$25 frente a $10/$50, no porque usara menos tokens.

Fable 5.1Fable 5Opus 5
Lista $ in/out$10/$50$10/$50$5/$25
Cache read$0.25 / MTok$1.00 / MTokn/a
Esfuerzo por defectoHigh en Claude Code; Medium en claude.ai / Coworkn/aHigh
Titular del vendorTerminal-Bench-Science 52.6%24.7%29.0%
Factura (nuestro medidor)$0.14693, 14/14$0.13285, 14/14$0.080725, 14/14
Cambia siagentes con mucha cachéllamadas cortas sin cachésingle-shot acotado

Mismos pesos, dos puertas, y una de ellas no responde

Mythos 5.1 son los mismos pesos con salvaguardas cyber/bio más laxas, y no está en OpenRouter.

La frase de lanzamiento de Anthropic es literal: «Claude Fable 5.1 and Claude Mythos 5.1 are the same model, but with different levels of safeguards.» Fable es GA (claude-fable-5-1, Bedrock anthropic.claude-fable-5-1). Mythos es claude-mythos-5-1 detrás de Project Glasswing / CVP / LSVP, hoy un conjunto de organizaciones de EE. UU. Contexto 1M, salida máx. 128k, corte jun 2026 frente al de Fable 5 en ene 2026. Nuestro experimento costó $0.53795. Mythos no se llamó.

python
# OpenRouter slugs we actually sent on 2026-09-02
MODELS = [
    "anthropic/claude-fable-5.1",
    "anthropic/claude-fable-5",
    "anthropic/claude-opus-5",
    # claude-mythos-5-1: not listed / Glasswing only
]

¿Qué benches de Claude Fable 5.1 se movieron de verdad?

Terminal-Bench-Science 0.1 es el salto: 52.6% en Fable 5.1 frente a 24.7% en Fable 5.

Fable 5 estaba en 24.7% y Opus 5 en 29.0%. Ese salto es por qué los bucles de codificación agéntica importan más que nuestras 14 llamadas cortas.

BenchFable 5.1Fable 5Opus 5GPT-5.6 Sol
Terminal-Bench-Science 0.152.6%24.7%29.0%22.4%
Terminal-Bench 4.055.8% (Mythos 5.1: 60.9%)42.0%52.3%37.3%
GDPval-AA v21853172318241711
OSWorld 2.0 partial / strict77.9% / 41.7%72.9% / 36.1%75.4% / 39.6%n/a
HLE no tools / with tools60.9% / 65.0%57.8% / 63.8%56.6% / 63.6%n/a
AutomationBench31.4%17.1%26.9%19.6%
CursorBench 3.2.073.4%70.5%70.0%67.2%

Fuente: anuncio de Anthropic, 2026-09-01.

FuenteHallazgoAlcance
Artificial Analysis, 2026-09-01Intelligence Index 66 a maxFable 5 max 62; Opus 5 max 63
Artificial Analysis$3.76 / tarea vs Fable 5 $3.14 (+20%)~1.7× salida; ~$5.16 sin el recorte; xhigh 65 a $2.72
Snorkel, 2026-09-0158% menos tokens, 36% más rápidovs éxitos de Opus 5 solo; 18 / 5 / 2 / 2; pass@1 61.5%; build/dep 18% vs 67%

El 58% / 36% de Snorkel es vs Opus 5 solo en ejecuciones exitosas, no vs Fable 5. Opus aún resolvió tres tareas más (18 ambos / 5 solo Opus / 2 solo Fable).

  1. Terminal-Bench-Science SE ±3.5-4.5 pts. El leaderboard público (3 trials/tarea, runner Claude Code) reporta Opus 5 30.0% y Fable 5 21.4%; el setup de Anthropic reproduce 29.0% y 24.7%, ambos dentro del ruido.
  2. OSWorld 2.0 es el release de tareas de agosto 2026 de los autores; Fable 5 y Opus 5 se reejecutaron bajo las mismas condiciones. No comparable con cifras antiguas de OSWorld.
  3. Las salvaguardas de producción estaban activas. Las intervenciones se puntuaron como cero en OSWorld (ambos Fable) y en AutomationBench (Fable 5). Otras tareas cyber cayeron a Opus 4.8; biología a Opus 5. Eso probablemente infraestima la capacidad cruda.

¿Está el ahorro del 25% de Claude Fable 5.1 en tu factura?

La línea de cache-read es un 75% más barata; el follow-up corto entero solo un 21% más barato.

El post de lanzamiento de Anthropic estima ~25% típico y ~45% de ahorro agéntico vs Fable 5. Ambos necesitan que las lecturas de caché dominen y que los tokens de salida no se disparen. La tarifa de docs: cache write $12.50 / $20, output $50, cache read $1.00 → $0.25 / MTok. Los modelos de coste por carga deciden si ese recorte sobrevive a bajar la factura de tokens en otro sitio.

EscenarioEtiquetaFable 5Fable 5.1Delta
Fila A: 20 turnos / ~1M (9.5M cache reads, writes $12.50, output $50)identidad de lista, no nuestro medidor$72.00 ($9.50 caché)$64.88 ($2.38 caché)-9.9%
Fila B: tarea Intelligence IndexArtificial Analysis, 2026-09-01$3.14$3.76 (~$5.16 sin el recorte)+20% a max (~1.7× salida)
Fila C: prefijo de 1,165 tokens, turno 2Techsy OpenRouter, 2026-09-02$0.005086$0.00402125turno entero 21% más barato
Línea turno 2 (Factura, nuestro medidor)Fable 5.1Fable 5
Tokens de input cacheados1,1651,166
Línea cache-read$0.000291$0.001166
OpenRouter usage.cost$0.00402125$0.005086

La línea de cache-read es un 75.0% más barata ($0.000291 vs $0.001166). El ahorro del turno completo se queda en 21% porque la salida sigue facturando a $50/M. Escala la línea de caché a 40 relecturas × 200.000 tokens: $2.00 en 5.1 vs $8.00 en 5.

AY Automate preguntó «Is Claude Fable 5.1 more expensive than Fable 5?» el 2026-09-01 y respondió «No.» El precio de lista no cambia: $10/$50. La factura sí: Artificial Analysis midió +20% a max, THE DECODER actualizó el mismo día con ese +20%, y nuestras 14 llamadas sin caché facturaron 1.11×.

El usuario de HN george_max (item 49525611, 2026-09-01) lo llamó «just cache reads» y «15% more», alineado con AA a max effort. Las ventanas de suscripción de 5 horas no cobran las lecturas de caché como la API.

Un quiz, no un bench: la respuesta de caché del turno 2 de Fable 5 usó $2.00 / $2.50 (precios de 5.1) en un prompt que decía «on this model.»

Qué mostró nuestro medidor OpenRouter con Claude Fable 5.1

Los tres modelos pasaron 14/14 con effort=low; Opus 5 fue un 45% más barato que Fable 5.1.

Benchmarkeamos 14 prompts. La precisión empató; Opus 5 ganó igual con $5/$25 frente a $10/$50.

  1. Cuándo: 2026-09-02, 08:55 UTC, OpenRouter chat-completions. Tarifas públicas en la página del modelo Fable 5.1.
  2. Qué: anthropic/claude-fable-5.1 vs anthropic/claude-fable-5 vs anthropic/claude-opus-5.
  3. Cómo: reasoning.effort=low salvo tres llamadas High de coding en Fable 5.1. Sin temperature (5.1 rechaza sampling no por defecto).
  4. Graders: JSON-schema, match numérico exacto, unit tests ejecutados. Artefactos: fable_bench.py, benchmark-raw.json, benchmark-aggregate.json. Probamos los tres slugs de nuestro benchmark: 49 llamadas, $0.53795.
Métrica (14 llamadas, effort=low)Fable 5.1Fable 5Opus 5
Tareas pasadas14/1414/1414/14
Latencia mediana5.647 s5.383 s4.797 s
Tokens de completion medianos9490103
Tokens de reasoning medianos0823
Total tokens de completion2,5472,2712,843
Total tokens de reasoning0253380
Coste total$0.14693$0.13285$0.080725

Coding pasó 6/6 en cada uno a low.

Tarea (2 trials)Fable 5.1 outFable 5 outOpus 5 out
merge_intervals175, 16896, 96155, 155
semver_satisfies414, 411405, 401493, 487
lru_ttl_cache387, 418395, 339469, 459
Latencia mediana coding6.523 s5.389 s6.316 s
Coste total coding$0.11095$0.09878$0.06154

Trata el «more concise in plans and summaries» de Anthropic como una afirmación sobre trazas de agentes, no sobre dumps de funciones single-shot. Fable 5.1 gastó ~175 tokens en merge_intervals donde Fable 5 gastó 96, ambos pasando.

Lo que esto no mide:

  • Mythos 5.1 (no invocable desde esta cuenta).
  • Agentes de varias horas, Terminal-Bench, SWE-bench, computer use.
  • Esfuerzo por defecto (fijamos low salvo la ronda 3).
  • Cache writes a TTL de 5 minutos vs 1 hora.
  • Rechazos, fallback a Opus, batching de bucles de herramientas.

¿Qué tres requests devuelven 400 en Fable 5.1?

Forzar tool_choice de tipo any o tool devuelve HTTP 400 en claude-fable-5-1.

What's new in Fable 5.1 nombra el error: tool_choice: type "tool" and "any" are not supported for this model. Prefill del turno assistant también es 400. temperature / top_p / top_k no por defecto también es 400; por eso no enviamos temperature. Los bloques thinking se atan al modelo que los produce (thinking-binding-controls-2026-08-01): 5.1 lee bloques anteriores, los modelos previos no pueden leer los de 5.1, y un fallback del router los descarta. Editar cualquier cosa delante de un bloque thinking de 5.1 falla o lo descarta en cuentas creadas el/desde 2026-08-31. Mythos 5.1 se salta esa comprobación de prefijo.

python
# HTTP 400 invalid_request_error on anthropic/claude-fable-5.1
payload = {
    "model": "anthropic/claude-fable-5.1",
    "messages": [{"role": "user", "content": "Look up the cache rate."}],
    "tools": [{"type": "function", "function": {"name": "lookup"}}],
    "tool_choice": {"type": "tool", "name": "lookup"},  # type "any" 400s too
}
# error: tool_choice: type "tool" and "any" are not supported for this model.
  1. Pon tool_choice en auto y strict: true en el schema de la herramienta, o pásate a structured outputs.
  2. Mantén el historial solo-append; nunca edites un prefijo delante de un bloque thinking de 5.1.
  3. Descarta los bloques thinking cuando hagas fallback a un modelo anterior.
  4. Omite temperature / top_p / top_k, y no hagas prefill del turno assistant.

¿Por qué Claude Code pone Fable 5.1 en High por defecto?

Claude Code pone Fable 5.1 en High por defecto; en lru_ttl_cache eso multiplicó ×4 una tarea que ya pasaba en Low.

El anuncio de Anthropic fija High en Claude Code y Medium en claude.ai / Cowork. Cinco niveles de esfuerzo: low / medium / high / xhigh / max. Thinking siempre activo; thinking: disabled es 400. El Help Center exige Claude Code 2.1.250 o posterior.

TareaLow (out / reason / coste)High (out / reason / coste / latencia)
merge_intervals172 / 0 / $0.010175 / 0 / $0.01024 / 4.86 s
semver_satisfies413 / 0 / $0.023401 / 0 / $0.02238 / 7.60 s
lru_ttl_cache403 / 0 / $0.0221,713 / 1,150 / $0.08798 / 22.07 s

merge_intervals y semver_satisfies se comportaron como Low. lru_ttl_cache no. High gastó 4.25× los tokens de completion (1,713 vs 403), añadió 1,150 tokens de reasoning, tardó 22.07 s vs ~7 s, y costó una factura 4.0× ($0.08798 vs $0.022) por tests que ya teníamos. Fija effort=low (o Medium en claude.ai) para funciones acotadas.

Simon Willison (2026-09-01, no nuestro pelican): el effort no se puede apagar; max fue 33× la salida de low en un prompt.

¿Te quedas en Fable 5, en Opus 5, o te mueves?

Quédate en Opus 5 para trabajo single-shot acotado; pasa los agentes con mucha caché a Fable 5.1.

Los docs dicen empezar con Opus 5 y llegar a Fable 5.1 cuando las evals a High effort siguen fallando. Nuestra eval es el medidor 14/14: Opus 5 a $0.0807 vs $0.1469 (45% más barato). No cambies Fable 5 a 5.1 para llamadas cortas sin caché: 14/14 ambos, 5.1 costó 1.11× más aquí.

ReglaCambia siFactura (nuestro medidor)
Quédate en Opus 5 para single-shot acotadolas evals a High effort siguen fallando en sesiones largas de agente$0.080725, 14/14, 45% más barato que $0.14693
Pasa agentes con mucha caché a Fable 5.1la sesión nunca relee un prefijo grandelínea cache-read 75.0% más barata ($0.000291 vs $0.001166)
No dejes Claude Code en High por defecto en tareas que ya pasan en Lowel trabajo es un bucle clase Terminal-Bench-Science4.0× en lru_ttl_cache ($0.08798 vs $0.022)
No cambies Fable 5 → 5.1 para llamadas cortas sin cachénecesitas el salto Science o el cache read a $0.251.11× ($0.14693 vs $0.13285), 14/14 ambos

Fable 5.1 facturó $0.14693 (1.11×) en 14/14 sin caché; la victoria es la línea de cache-read. Fable 5 facturó $0.13285 hasta que un prefijo de 1,165 tokens se relee. Opus 5 facturó $0.080725, 45% más barato, con más tokens (2,843 vs 2,547).

El trabajo single-shot acotado se queda en Opus 5. Los agentes con mucha caché pasan a Fable 5.1 por la línea de cache-read a $0.25, con effort fijado en Low cuando los tests ya pasan. Las llamadas cortas sin caché a Fable 5 se quedan donde están.

Preguntas frecuentes

¿Cuál es el API ID de Claude Fable 5.1?

claude-fable-5-1 en la API de Anthropic, anthropic.claude-fable-5-1 en Bedrock, y anthropic/claude-fable-5.1 en OpenRouter. Vertex, Foundry y Claude Platform mantienen claude-fable-5-1. Mythos es claude-mythos-5-1, solo Glasswing; no figura como modelo tipable en OpenRouter, y no lo llamamos el 2026-09-02.

¿El recorte de cache-read aplica a las cuotas de Claude Code Max?

No. El recorte del 75% es un precio de cache-read de API ($1.00 → $0.25 / MTok). Las ventanas de suscripción de 5 horas no cobran las lecturas de caché así, así que el ahorro típico del 25% no estira las cuotas Max. r/ClaudeCode (2026-09-01) reportó quemar la ventana de 5 horas en 20 minutos tras aterrizar el High por defecto.

¿Qué versión de Claude Code necesita Fable 5.1?

2.1.250 o posterior, según el Help Center el 2026-09-01. Fable 5 pedía 2.1.170+. Builds más viejos pierden el ID nuevo, el High por defecto que ×4.0 nuestra tarea LRU, y el selector de effort que 5.1 espera. Actualiza antes de apuntar tráfico.

¿Fable 6 es lo siguiente?

5.1 es la point-release que ese post anticipó. Fable 6 sigue sin anunciarse. Los hilos de Polymarket pidiendo fecha de 5.1 están obsoletos: el GA fue 2026-09-01, y el anuncio no nombra calendario de Fable 6. No aparques un cambio 5 vs 5.1 esperándolo.

¿Claude Fable 5.1 es un Covered Model?

Sí. Retención de datos de 30 días. No disponible bajo zero data retention salvo autorización expresa. Enterprise Frontier Safeguards (almacenamiento en nube del cliente) llega más adelante este otoño; los clientes elegibles pueden usar ZDR hasta entonces. Un watermark estadístico de texto se envía en todas las plataformas (EU AI Act, modelos posteriores a 2026-08-02); la API de detección está en private preview.

Etiquetas

claude-fable-5-1claude-mythos-5-1prompt-cachingclaude-opus-5openrouter

Compartir este artículo

Inicia Tu Proyecto

¿Listo para construir algo extraordinario?

Convirtamos tu visión en realidad. Nuestro equipo está listo para ayudarte a crear software que marque la diferencia.