
Claude Fable 5.1 Review: Lo medimos frente a Fable 5 y Opus 5
Claude Fable 5.1 salió el 2026-09-01 al mismo $10/$50 que Fable 5, con lecturas de caché bajadas a $0.25. Al día siguiente, a las 08:55 UTC, corrimos 14 tareas emparejadas en OpenRouter. El ahorro agéntico del 45% no apareció en esa factura: los tres modelos pasaron 14/14, y 5.1 facturó $0.14693 frente a Opus 5 a $0.080725.
El ID frontier de disponibilidad general de Anthropic es claude-fable-5-1, GA 2026-09-01, $10/$50 por millón de tokens, cache read $0.25. Mythos 5.1 son los mismos pesos con salvaguardas distintas (más laxas en cyber/bio), solo Glasswing. Corte de conocimiento jun 2026. Thinking siempre activo.
Claude Fable 5.1 vs Fable 5 vs Opus 5: la tabla de cambio
Quédate en Opus 5 para este set de 14 tareas; Fable 5.1 empató en precisión y costó 1.11× Fable 5.
Llamamos a anthropic/claude-fable-5.1 la mañana después del GA. La ficha de precios no se movió: $10/$50, igual que Fable 5. Claude Opus 5 va a $5/$25. Cache read es el único cambio de lista ($0.25 vs $1.00), y aquí no se disparó.
Opus 5 es un 45% más barato que Fable 5.1 en este set de 14 tareas porque el precio de lista es $5/$25 frente a $10/$50, no porque usara menos tokens.
| Fable 5.1 | Fable 5 | Opus 5 | |
|---|---|---|---|
| Lista $ in/out | $10/$50 | $10/$50 | $5/$25 |
| Cache read | $0.25 / MTok | $1.00 / MTok | n/a |
| Esfuerzo por defecto | High en Claude Code; Medium en claude.ai / Cowork | n/a | High |
| Titular del vendor | Terminal-Bench-Science 52.6% | 24.7% | 29.0% |
| Factura (nuestro medidor) | $0.14693, 14/14 | $0.13285, 14/14 | $0.080725, 14/14 |
| Cambia si | agentes con mucha caché | llamadas cortas sin caché | single-shot acotado |
Mismos pesos, dos puertas, y una de ellas no responde
Mythos 5.1 son los mismos pesos con salvaguardas cyber/bio más laxas, y no está en OpenRouter.
La frase de lanzamiento de Anthropic es literal: «Claude Fable 5.1 and Claude Mythos 5.1 are the same model, but with different levels of safeguards.» Fable es GA (claude-fable-5-1, Bedrock anthropic.claude-fable-5-1). Mythos es claude-mythos-5-1 detrás de Project Glasswing / CVP / LSVP, hoy un conjunto de organizaciones de EE. UU. Contexto 1M, salida máx. 128k, corte jun 2026 frente al de Fable 5 en ene 2026. Nuestro experimento costó $0.53795. Mythos no se llamó.
# OpenRouter slugs we actually sent on 2026-09-02
MODELS = [
"anthropic/claude-fable-5.1",
"anthropic/claude-fable-5",
"anthropic/claude-opus-5",
# claude-mythos-5-1: not listed / Glasswing only
]¿Qué benches de Claude Fable 5.1 se movieron de verdad?
Terminal-Bench-Science 0.1 es el salto: 52.6% en Fable 5.1 frente a 24.7% en Fable 5.
Fable 5 estaba en 24.7% y Opus 5 en 29.0%. Ese salto es por qué los bucles de codificación agéntica importan más que nuestras 14 llamadas cortas.
| Bench | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | 29.0% | 22.4% |
| Terminal-Bench 4.0 | 55.8% (Mythos 5.1: 60.9%) | 42.0% | 52.3% | 37.3% |
| GDPval-AA v2 | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0 partial / strict | 77.9% / 41.7% | 72.9% / 36.1% | 75.4% / 39.6% | n/a |
| HLE no tools / with tools | 60.9% / 65.0% | 57.8% / 63.8% | 56.6% / 63.6% | n/a |
| AutomationBench | 31.4% | 17.1% | 26.9% | 19.6% |
| CursorBench 3.2.0 | 73.4% | 70.5% | 70.0% | 67.2% |
Fuente: anuncio de Anthropic, 2026-09-01.
| Fuente | Hallazgo | Alcance |
|---|---|---|
| Artificial Analysis, 2026-09-01 | Intelligence Index 66 a max | Fable 5 max 62; Opus 5 max 63 |
| Artificial Analysis | $3.76 / tarea vs Fable 5 $3.14 (+20%) | ~1.7× salida; ~$5.16 sin el recorte; xhigh 65 a $2.72 |
| Snorkel, 2026-09-01 | 58% menos tokens, 36% más rápido | vs éxitos de Opus 5 solo; 18 / 5 / 2 / 2; pass@1 61.5%; build/dep 18% vs 67% |
El 58% / 36% de Snorkel es vs Opus 5 solo en ejecuciones exitosas, no vs Fable 5. Opus aún resolvió tres tareas más (18 ambos / 5 solo Opus / 2 solo Fable).
- Terminal-Bench-Science SE ±3.5-4.5 pts. El leaderboard público (3 trials/tarea, runner Claude Code) reporta Opus 5 30.0% y Fable 5 21.4%; el setup de Anthropic reproduce 29.0% y 24.7%, ambos dentro del ruido.
- OSWorld 2.0 es el release de tareas de agosto 2026 de los autores; Fable 5 y Opus 5 se reejecutaron bajo las mismas condiciones. No comparable con cifras antiguas de OSWorld.
- Las salvaguardas de producción estaban activas. Las intervenciones se puntuaron como cero en OSWorld (ambos Fable) y en AutomationBench (Fable 5). Otras tareas cyber cayeron a Opus 4.8; biología a Opus 5. Eso probablemente infraestima la capacidad cruda.
¿Está el ahorro del 25% de Claude Fable 5.1 en tu factura?
La línea de cache-read es un 75% más barata; el follow-up corto entero solo un 21% más barato.
El post de lanzamiento de Anthropic estima ~25% típico y ~45% de ahorro agéntico vs Fable 5. Ambos necesitan que las lecturas de caché dominen y que los tokens de salida no se disparen. La tarifa de docs: cache write $12.50 / $20, output $50, cache read $1.00 → $0.25 / MTok. Los modelos de coste por carga deciden si ese recorte sobrevive a bajar la factura de tokens en otro sitio.
| Escenario | Etiqueta | Fable 5 | Fable 5.1 | Delta |
|---|---|---|---|---|
| Fila A: 20 turnos / ~1M (9.5M cache reads, writes $12.50, output $50) | identidad de lista, no nuestro medidor | $72.00 ($9.50 caché) | $64.88 ($2.38 caché) | -9.9% |
| Fila B: tarea Intelligence Index | Artificial Analysis, 2026-09-01 | $3.14 | $3.76 (~$5.16 sin el recorte) | +20% a max (~1.7× salida) |
| Fila C: prefijo de 1,165 tokens, turno 2 | Techsy OpenRouter, 2026-09-02 | $0.005086 | $0.00402125 | turno entero 21% más barato |
| Línea turno 2 (Factura, nuestro medidor) | Fable 5.1 | Fable 5 |
|---|---|---|
| Tokens de input cacheados | 1,165 | 1,166 |
| Línea cache-read | $0.000291 | $0.001166 |
OpenRouter usage.cost | $0.00402125 | $0.005086 |
La línea de cache-read es un 75.0% más barata ($0.000291 vs $0.001166). El ahorro del turno completo se queda en 21% porque la salida sigue facturando a $50/M. Escala la línea de caché a 40 relecturas × 200.000 tokens: $2.00 en 5.1 vs $8.00 en 5.
AY Automate preguntó «Is Claude Fable 5.1 more expensive than Fable 5?» el 2026-09-01 y respondió «No.» El precio de lista no cambia: $10/$50. La factura sí: Artificial Analysis midió +20% a max, THE DECODER actualizó el mismo día con ese +20%, y nuestras 14 llamadas sin caché facturaron 1.11×.
El usuario de HN george_max (item 49525611, 2026-09-01) lo llamó «just cache reads» y «15% more», alineado con AA a max effort. Las ventanas de suscripción de 5 horas no cobran las lecturas de caché como la API.
Un quiz, no un bench: la respuesta de caché del turno 2 de Fable 5 usó $2.00 / $2.50 (precios de 5.1) en un prompt que decía «on this model.»
Qué mostró nuestro medidor OpenRouter con Claude Fable 5.1
Los tres modelos pasaron 14/14 con effort=low; Opus 5 fue un 45% más barato que Fable 5.1.
Benchmarkeamos 14 prompts. La precisión empató; Opus 5 ganó igual con $5/$25 frente a $10/$50.
- Cuándo: 2026-09-02, 08:55 UTC, OpenRouter chat-completions. Tarifas públicas en la página del modelo Fable 5.1.
- Qué:
anthropic/claude-fable-5.1vsanthropic/claude-fable-5vsanthropic/claude-opus-5. - Cómo:
reasoning.effort=lowsalvo tres llamadas High de coding en Fable 5.1. Sintemperature(5.1 rechaza sampling no por defecto). - Graders: JSON-schema, match numérico exacto, unit tests ejecutados. Artefactos:
fable_bench.py,benchmark-raw.json,benchmark-aggregate.json. Probamos los tres slugs de nuestro benchmark: 49 llamadas, $0.53795.
| Métrica (14 llamadas, effort=low) | Fable 5.1 | Fable 5 | Opus 5 |
|---|---|---|---|
| Tareas pasadas | 14/14 | 14/14 | 14/14 |
| Latencia mediana | 5.647 s | 5.383 s | 4.797 s |
| Tokens de completion medianos | 94 | 90 | 103 |
| Tokens de reasoning medianos | 0 | 8 | 23 |
| Total tokens de completion | 2,547 | 2,271 | 2,843 |
| Total tokens de reasoning | 0 | 253 | 380 |
| Coste total | $0.14693 | $0.13285 | $0.080725 |
Coding pasó 6/6 en cada uno a low.
| Tarea (2 trials) | Fable 5.1 out | Fable 5 out | Opus 5 out |
|---|---|---|---|
merge_intervals | 175, 168 | 96, 96 | 155, 155 |
semver_satisfies | 414, 411 | 405, 401 | 493, 487 |
lru_ttl_cache | 387, 418 | 395, 339 | 469, 459 |
| Latencia mediana coding | 6.523 s | 5.389 s | 6.316 s |
| Coste total coding | $0.11095 | $0.09878 | $0.06154 |
Trata el «more concise in plans and summaries» de Anthropic como una afirmación sobre trazas de agentes, no sobre dumps de funciones single-shot. Fable 5.1 gastó ~175 tokens en merge_intervals donde Fable 5 gastó 96, ambos pasando.
Lo que esto no mide:
- Mythos 5.1 (no invocable desde esta cuenta).
- Agentes de varias horas, Terminal-Bench, SWE-bench, computer use.
- Esfuerzo por defecto (fijamos
lowsalvo la ronda 3). - Cache writes a TTL de 5 minutos vs 1 hora.
- Rechazos, fallback a Opus, batching de bucles de herramientas.
¿Qué tres requests devuelven 400 en Fable 5.1?
Forzar tool_choice de tipo any o tool devuelve HTTP 400 en claude-fable-5-1.
What's new in Fable 5.1 nombra el error: tool_choice: type "tool" and "any" are not supported for this model. Prefill del turno assistant también es 400. temperature / top_p / top_k no por defecto también es 400; por eso no enviamos temperature. Los bloques thinking se atan al modelo que los produce (thinking-binding-controls-2026-08-01): 5.1 lee bloques anteriores, los modelos previos no pueden leer los de 5.1, y un fallback del router los descarta. Editar cualquier cosa delante de un bloque thinking de 5.1 falla o lo descarta en cuentas creadas el/desde 2026-08-31. Mythos 5.1 se salta esa comprobación de prefijo.
# HTTP 400 invalid_request_error on anthropic/claude-fable-5.1
payload = {
"model": "anthropic/claude-fable-5.1",
"messages": [{"role": "user", "content": "Look up the cache rate."}],
"tools": [{"type": "function", "function": {"name": "lookup"}}],
"tool_choice": {"type": "tool", "name": "lookup"}, # type "any" 400s too
}
# error: tool_choice: type "tool" and "any" are not supported for this model.- Pon
tool_choiceenautoystrict: trueen el schema de la herramienta, o pásate a structured outputs. - Mantén el historial solo-append; nunca edites un prefijo delante de un bloque thinking de 5.1.
- Descarta los bloques thinking cuando hagas fallback a un modelo anterior.
- Omite
temperature/top_p/top_k, y no hagas prefill del turno assistant.
¿Por qué Claude Code pone Fable 5.1 en High por defecto?
Claude Code pone Fable 5.1 en High por defecto; en lru_ttl_cache eso multiplicó ×4 una tarea que ya pasaba en Low.
El anuncio de Anthropic fija High en Claude Code y Medium en claude.ai / Cowork. Cinco niveles de esfuerzo: low / medium / high / xhigh / max. Thinking siempre activo; thinking: disabled es 400. El Help Center exige Claude Code 2.1.250 o posterior.
| Tarea | Low (out / reason / coste) | High (out / reason / coste / latencia) |
|---|---|---|
merge_intervals | 172 / 0 / $0.010 | 175 / 0 / $0.01024 / 4.86 s |
semver_satisfies | 413 / 0 / $0.023 | 401 / 0 / $0.02238 / 7.60 s |
lru_ttl_cache | 403 / 0 / $0.022 | 1,713 / 1,150 / $0.08798 / 22.07 s |
merge_intervals y semver_satisfies se comportaron como Low. lru_ttl_cache no. High gastó 4.25× los tokens de completion (1,713 vs 403), añadió 1,150 tokens de reasoning, tardó 22.07 s vs ~7 s, y costó una factura 4.0× ($0.08798 vs $0.022) por tests que ya teníamos. Fija effort=low (o Medium en claude.ai) para funciones acotadas.
Simon Willison (2026-09-01, no nuestro pelican): el effort no se puede apagar; max fue 33× la salida de low en un prompt.
¿Te quedas en Fable 5, en Opus 5, o te mueves?
Quédate en Opus 5 para trabajo single-shot acotado; pasa los agentes con mucha caché a Fable 5.1.
Los docs dicen empezar con Opus 5 y llegar a Fable 5.1 cuando las evals a High effort siguen fallando. Nuestra eval es el medidor 14/14: Opus 5 a $0.0807 vs $0.1469 (45% más barato). No cambies Fable 5 a 5.1 para llamadas cortas sin caché: 14/14 ambos, 5.1 costó 1.11× más aquí.
| Regla | Cambia si | Factura (nuestro medidor) |
|---|---|---|
| Quédate en Opus 5 para single-shot acotado | las evals a High effort siguen fallando en sesiones largas de agente | $0.080725, 14/14, 45% más barato que $0.14693 |
| Pasa agentes con mucha caché a Fable 5.1 | la sesión nunca relee un prefijo grande | línea cache-read 75.0% más barata ($0.000291 vs $0.001166) |
| No dejes Claude Code en High por defecto en tareas que ya pasan en Low | el trabajo es un bucle clase Terminal-Bench-Science | 4.0× en lru_ttl_cache ($0.08798 vs $0.022) |
| No cambies Fable 5 → 5.1 para llamadas cortas sin caché | necesitas el salto Science o el cache read a $0.25 | 1.11× ($0.14693 vs $0.13285), 14/14 ambos |
Fable 5.1 facturó $0.14693 (1.11×) en 14/14 sin caché; la victoria es la línea de cache-read. Fable 5 facturó $0.13285 hasta que un prefijo de 1,165 tokens se relee. Opus 5 facturó $0.080725, 45% más barato, con más tokens (2,843 vs 2,547).
- Fable 5 vs Opus 4.8 vive en el post del lanzamiento de junio.
- Claude Opus 5 cubre los precios de la línea Opus.
- 5.1 es la point-release que ese post anticipó; Fable 6 sigue sin anunciarse.
- Q&A de controles de exportación para el tirón anterior de Fable 5.
- Eficiencia de tokens como eje de ranking vive en Grok 4.6.
- Enruta Opus vs Fable en producción.
El trabajo single-shot acotado se queda en Opus 5. Los agentes con mucha caché pasan a Fable 5.1 por la línea de cache-read a $0.25, con effort fijado en Low cuando los tests ya pasan. Las llamadas cortas sin caché a Fable 5 se quedan donde están.
Preguntas frecuentes
¿Cuál es el API ID de Claude Fable 5.1?
claude-fable-5-1 en la API de Anthropic, anthropic.claude-fable-5-1 en Bedrock, y anthropic/claude-fable-5.1 en OpenRouter. Vertex, Foundry y Claude Platform mantienen claude-fable-5-1. Mythos es claude-mythos-5-1, solo Glasswing; no figura como modelo tipable en OpenRouter, y no lo llamamos el 2026-09-02.
¿El recorte de cache-read aplica a las cuotas de Claude Code Max?
No. El recorte del 75% es un precio de cache-read de API ($1.00 → $0.25 / MTok). Las ventanas de suscripción de 5 horas no cobran las lecturas de caché así, así que el ahorro típico del 25% no estira las cuotas Max. r/ClaudeCode (2026-09-01) reportó quemar la ventana de 5 horas en 20 minutos tras aterrizar el High por defecto.
¿Qué versión de Claude Code necesita Fable 5.1?
2.1.250 o posterior, según el Help Center el 2026-09-01. Fable 5 pedía 2.1.170+. Builds más viejos pierden el ID nuevo, el High por defecto que ×4.0 nuestra tarea LRU, y el selector de effort que 5.1 espera. Actualiza antes de apuntar tráfico.
¿Fable 6 es lo siguiente?
5.1 es la point-release que ese post anticipó. Fable 6 sigue sin anunciarse. Los hilos de Polymarket pidiendo fecha de 5.1 están obsoletos: el GA fue 2026-09-01, y el anuncio no nombra calendario de Fable 6. No aparques un cambio 5 vs 5.1 esperándolo.
¿Claude Fable 5.1 es un Covered Model?
Sí. Retención de datos de 30 días. No disponible bajo zero data retention salvo autorización expresa. Enterprise Frontier Safeguards (almacenamiento en nube del cliente) llega más adelante este otoño; los clientes elegibles pueden usar ZDR hasta entonces. Un watermark estadístico de texto se envía en todas las plataformas (EU AI Act, modelos posteriores a 2026-08-02); la API de detección está en private preview.