
Claude Fable 5 vs Opus 4.8: ¿Vale la pena cambiar? (Clase Mythos, con benchmarks)
Anthropic lanzó Claude Fable 5 hoy, 9 de junio de 2026. Obtiene un 80.3% en SWE-Bench Pro, el benchmark de codificación agéntica donde Opus 4.8 consigue un 69.2% y GPT-5.5 se queda en el 58.6%. No es una diferencia marginal. Y hay un giro: Fable 5 es la mitad pública y con salvaguardas de un nuevo nivel de modelos llamado "clase Mythos", con un hermano restringido llamado Claude Mythos 5 que se mantiene detrás de un programa de acceso controlado. Esto es lo que cambió, cuánto cuesta una tarea real a $10/$50 por millón de tokens, y si realmente deberías mover tu stack fuera de Opus 4.8.
Respuesta rápida
- Fable 5 obtiene 80.3% en SWE-Bench Pro frente al 69.2% de Opus 4.8 y el 58.6% de GPT-5.5.
- El precio es $10 de entrada / $50 de salida por millón de tokens, menos de la mitad de Mythos Preview.
- Fable 5 cae automáticamente a Opus 4.8 en consultas de alto riesgo (cyber, bio, química). Ocurre en menos del 5% de las sesiones.
- Gratis en los planes Pro/Max/Team/Enterprise hasta el 22 de junio de 2026; los créditos de uso se aplican desde el 23 de junio.
Qué se lanzó exactamente: Fable 5, Mythos 5 y la línea "clase Mythos"
Clase Mythos es el nuevo nivel de máxima capacidad de Anthropic, y se lanza como dos modelos. Claude Fable 5 es la versión pública y con salvaguardas que puedes usar hoy. Claude Mythos 5 es el mismo modelo frontier sin las salvaguardas, disponible solo bajo acceso controlado. El mismo cerebro, dos posturas de lanzamiento.
La división es la historia completa. Según el anuncio oficial de Anthropic, Mythos 5 conserva toda la capacidad frontier, incluidas habilidades de ciberataque ofensivo que podrían causar daño real, por lo que Anthropic no lo pone a disposición de todos. Fable 5 toma ese mismo modelo y lo envuelve en clasificadores que detectan solicitudes de alto riesgo y las redirigen silenciosamente a Opus 4.8 en su lugar.
Así que cuando llamas a Fable 5, obtienes razonamiento de clase Mythos en todo lo que no es peligroso, y un modelo de respaldo más seguro en la pequeña fracción que sí lo es. CNBC lo describió como Anthropic lanzando "una IA similar a Mythos al público", lo cual es correcto, pero el mecanismo preciso importa más que el titular.
Fable 5 y Mythos 5 son el mismo modelo frontier dividido en dos: uno disponible hoy, otro que Anthropic mantiene bajo llave. Si solo recuerdas una cosa del nombre, recuerda eso. Clase Mythos es el nivel; Fable y Mythos son las dos puertas hacia él.
Qué cambió respecto a la línea Opus 4.x
En cada evaluación de codificación y razonamiento que publicó Anthropic, Fable 5 supera a Opus 4.8, no por los pelos sino por márgenes de dos dígitos. SWE-Bench Pro salta del 69.2% al 80.3%. FrontierCode Diamond pasa de 13.4 a 29.3. El precio también bajó, y el modelo escala con un nuevo dial de esfuerzo de razonamiento. Este es un salto frontier real sobre la línea Opus 4.x, no una versión menor.

La comparación de los 13 benchmarks de arriba es la vista rápida. Aquí está el subconjunto principal contra los tres modelos que la mayoría de los equipos realmente comparan:
| Benchmark | Claude Fable 5 | Claude Opus 4.8 | GPT-5.5 |
|---|---|---|---|
| SWE-Bench Pro (codificación agéntica) | 80.3% | 69.2% | 58.6% |
| FrontierCode Diamond (codificación más difícil) | 29.3 | 13.4 | 5.7 |
| Terminal-Bench 2.1 (shell agéntico) | 88.0% | n/a | n/a |
| GPQA-AA (razonamiento de posgrado, Elo) | 1932 | n/a | n/a |
| ExploitBench | 78.0% | n/a | n/a |
El punto de comparación aquí es Claude Opus 4.8, el modelo al que Fable 5 reemplaza en la frontera, y el mismo al que Fable 5 recurre en consultas de alto riesgo. Si has seguido la línea Opus 4.x a lo largo de las dos últimas versiones, el patrón era de mejoras incrementales. Fable 5 rompe ese patrón.
Dos cosas que hay que aclarar antes de leer la tabla como un evangelio. Primero, estas son las evaluaciones publicadas por el propio Anthropic, no una prueba independiente. Segundo, el dial de esfuerzo de razonamiento significa que un solo número de benchmark oculta una curva de costes. Más sobre eso en la sección de precios, porque cambia el cálculo.
Los benchmarks que importan a los desarrolladores
Cuatro números tienen el peso práctico real: SWE-Bench Pro 80.3%, FrontierCode Diamond 29.3, Terminal-Bench 2.1 88.0% y GPQA-AA 1932 Elo. Juntos cubren trabajo real en repositorios, los problemas de codificación sintéticos más difíciles, tareas de shell agéntico y razonamiento a nivel de posgrado. Si tu carga de trabajo toca alguno de esos, esta sección te dice si el número se aplica a tu trabajo.
El gráfico principal al inicio de este artículo es la prueba: SWE-Bench Pro 80.3 vs 69.2 vs 58.6, y FrontierCode 29.3 vs 13.4 vs 5.7. ¿Qué miden exactamente?
- SWE-Bench Pro prueba si un modelo puede enviar un pull request real a un repositorio real: clonar, entender, parchear, pasar las pruebas. Fable 5 lo logra en 8 de cada 10 casos. Es el proxy más cercano a "¿puede hacer mi trabajo real?"
- Terminal-Bench 2.1 puntúa tareas de shell agéntico: ejecutar comandos, leer la salida, recuperarse de errores. El 88.0% importa si estás construyendo agentes de codificación de IA que viven en una terminal.
- FrontierCode Diamond es el nivel más difícil de problemas de codificación, los que la mayoría de los modelos apenas pasan de un dígito. 29.3 es bajo en términos absolutos pero más del doble del 13.4 de Opus 4.8.
- GPQA-AA es razonamiento científico de nivel de posgrado, puntuado como un rating Elo. 1932 indica un razonamiento de múltiples pasos sólido, más allá del código.
En nuestros flujos de trabajo con Claude Code a lo largo de la línea Opus 4.x, el techo recurrente eran las tareas agénticas de largo alcance: el modelo perdía el hilo a mitad de un cambio en múltiples archivos. Los números de Terminal-Bench y SWE-Bench Pro de Fable 5 sugieren que ese techo se movió. Si se movió para tu repositorio es la única prueba que cuenta, pero los números publicados son exactamente del tipo que deberías tener en cuenta.
Casos de uso reales: qué puede hacer Fable 5 que los modelos anteriores no podían
Anthropic publicó tres ejemplos concretos que muestran la clase de problemas que Fable 5 puede resolver ahora: una migración del código base de Stripe comprimida de meses a un día, un videojuego completado solo con visión, y un salto de rendimiento de 3× gracias a la auto-validación. Cada uno apunta a una capacidad que los modelos anteriores no podían alcanzar. Los tres son de fuentes de Anthropic; citamos su anuncio, no una prueba propia.
Esto es lo que demuestra cada uno:
-
Migración Ruby de Stripe. Anthropic informa que Fable 5 comprimió una migración de código base Ruby de aproximadamente dos meses a alrededor de un día. Ese es el tamaño de problema que este modelo cambia. Esta es la clase de refactorización de largo alcance que antes requería un equipo humano con todo el código base en la cabeza.
-
Pokémon FireRed solo con visión. Según Anthropic, Fable 5 completó Pokémon FireRed usando solo visión, donde los modelos anteriores necesitaban complejos arneses personalizados para pasar el estado del juego como texto. Es un salto en razonamiento espacial y visual: el modelo lee la pantalla y actúa, sin andamiaje.
-
Slay the Spire, 3×. Con el máximo esfuerzo de razonamiento, Anthropic dice que Fable 5 auto-valida sus propios movimientos y alcanzó un rendimiento 3× mejor mediante memoria persistente. La conclusión no es el juego; es que el modelo puede verificar su propio trabajo a lo largo de un horizonte de planificación largo y mejorar a partir de ello.
Ninguna de estas es algo que debas dar por sentado para tu carga de trabajo. Pero se mapean claramente con los saltos de benchmark en la tabla anterior: codificación de largo alcance (SWE-Bench Pro), razonamiento espacial (visión) y auto-validación (el dial de esfuerzo de razonamiento). Los logros cualitativos y los cuantitativos cuentan la misma historia.
Precios y la realidad del coste por tarea
Fable 5 cuesta $10 por millón de tokens de entrada y $50 por millón de tokens de salida. Anthropic lo enmarca como "menos de la mitad del precio de Claude Mythos Preview". También es aproximadamente 2× Opus 4.8 por token. Ambas cosas son ciertas. El problema es que el precio por token es la unidad equivocada. Lo que realmente pagas es una tarea terminada, y ahí es donde el cálculo de Fable 5 se vuelve interesante.

El esfuerzo de razonamiento es un dial que configuras por solicitud. El esfuerzo bajo significa menos tokens de razonamiento interno y una respuesta más barata y rápida; el esfuerzo máximo significa que el modelo piensa más, gasta más tokens de salida y puntúa más alto. El gráfico anterior muestra a Fable 5 escalando de ~11% a ~31% en FrontierCode a medida que el esfuerzo sube de bajo a máximo, mientras Opus 4.8 llega a alrededor del 13% y GPT-5.5 se mantiene plano cerca del 5-6%. Así que el coste por tarea no es un número único; es una curva en la que eliges un punto.
Trabajemos un ejemplo concreto con los precios publicados de $10/$50. Es aritmética de las tarifas publicadas por Anthropic, no un resultado de benchmark.
Toma una llamada agéntica individual con 50.000 tokens de entrada y 15.000 tokens de salida con esfuerzo alto:
Entrada: 50.000 / 1.000.000 × $10 = $0.50
Salida: 15.000 / 1.000.000 × $50 = $0.75
Por llamada: $1.25Una tarea agéntica real encadena muchas llamadas así: leer el repositorio, planificar, editar, ejecutar pruebas, corregir, repetir. Supongamos que el bucle corre 12 llamadas con esa forma: aproximadamente $15 por la tarea terminada. Con el máximo esfuerzo de razonamiento y contexto más pesado, la propia curva de costes de Anthropic sitúa las tareas difíciles de FrontierCode cerca del rango de $20 por tarea. Ejecuta la misma tarea en GPT-5.5 y pagarás menos por token. Pero si no puede terminar la tarea a ningún nivel de esfuerzo, tu coste por tarea terminada es infinito. Fable 5 cuesta más por token que GPT-5.5, y aun así gana en coste por tarea terminada, porque completa trabajo que GPT-5.5 no puede.
Aquí tienes una llamada mínima. El anuncio de Anthropic da claude-fable-5 como identificador del modelo; verifica la cadena exacta con versión en la documentación de la API de Anthropic antes de desplegar, ya que los alias con fecha a veces difieren:
import anthropic
client = anthropic.Anthropic()
message = client.messages.create(
model="claude-fable-5", # verify exact dated id in API docs
max_tokens=4096,
thinking={"type": "enabled", "budget_tokens": 8000}, # reasoning effort
messages=[
{"role": "user", "content": "Migrate this module from Ruby 2.7 to 3.3 and run the tests."}
],
)
print(message.content)La tesis económica en una línea: pagas más por token que con GPT-5.5, pero terminas tareas que GPT-5.5 no puede terminar a ningún precio. Para trabajo de alto volumen y bajo riesgo, ese cálculo favorece un modelo más barato. Para codificación agéntica difícil, favorece a Fable 5.
La división de salvaguardas: por qué Fable recurre a Opus 4.8
Fable 5 ejecuta clasificadores en cada solicitud. Cuando detecta una consulta de alto riesgo (ciberataque ofensivo, bio, química o intentos de destilación del modelo), recurre a Opus 4.8 en lugar de responder con toda la capacidad de clase Mythos. Anthropic dice que este respaldo se activa en menos del 5% de las sesiones, por lo que la mayoría de los usuarios nunca lo desencadenan. El objetivo es mantener la capacidad peligrosa detrás de la barrera mientras se deja el trabajo cotidiano intacto.

El número más revelador es la tasa de éxito de ataques: con qué frecuencia un atacante automatizado puede hacer jailbreak al modelo para que haga algo que no debería. Menos es mejor. Los resultados del red-team de Anthropic muestran una caída pronunciada entre versiones: de Opus 4.6 al 83.2%, a Opus 4.7 al 72.7%, a Opus 4.8 al 56.6%, hasta llegar a Fable 5 al 5.4%. Bajo red-teaming automatizado, los ataques tuvieron éxito contra Fable 5 solo el 5.4% de las veces, frente al 56.6% en Opus 4.8.
¿Por qué debería importarte? Si despliegas un agente con acceso a herramientas (shell, sistema de archivos, red), un jailbreak no es una mala respuesta en el chat, es el modelo ejecutando comandos reales hacia donde un atacante lo dirigió. Una tasa de éxito de ataque del 5.4% significa que es aproximadamente diez veces más difícil de weaponizar que Opus 4.8. La cobertura de IT Pro destacó el mecanismo de respaldo exactamente por esta razón: es la función que hace que un modelo frontier sea lo suficientemente seguro para ponerlo en manos del público.
La contrapartida es la latencia. Si tu flujo de trabajo toca legítimamente herramientas de seguridad, el respaldo puede activarse a mitad de una tarea y cambiar de modelo, algo que hay que planificar.
Claude Mythos 5 y la pregunta del uso dual
Claude Mythos 5 es el hermano restringido: el mismo modelo sin el respaldo de salvaguardas. Conserva la capacidad de ciberataque ofensivo que Fable 5 bloquea, que es exactamente por qué Anthropic no lo lanza públicamente. El acceso se gestiona a través del Proyecto Glasswing, un programa evaluado para defensores e investigadores que necesitan capacidad completa. El mismo modelo, dos posturas de lanzamiento: uno abierto, otro restringido.

El gráfico hace visible la restricción. En las evaluaciones de ciberataque ofensivo (Firefox, OSS-Fuzz, CyberGym, CyScenarioBench), Mythos 5 obtiene 88.4, 24.0, 83.8 y 38.7. Fable 5 devuelve un plano 0.0 en los cuatro. En las evaluaciones de ciberataque ofensivo, Mythos 5 obtiene hasta 88.4 donde Fable 5 devuelve un plano 0.0: la división de salvaguardas, hecha visible.
Ese cero no es una brecha de capacidad. Es el respaldo activándose cada vez, bloqueando la solicitud antes de que el modelo de clase Mythos responda. TechCrunch señaló el momento: Anthropic lanzó esto días después de advertir que la IA se está volviendo demasiado peligrosa para lanzarse abiertamente. La división Fable/Mythos es la respuesta política a esa advertencia: publicar la capacidad, restringir el peligro.
Para la mayoría de los desarrolladores, Mythos 5 no es relevante. Nunca calificarás para el Proyecto Glasswing y no lo necesitas. Lo que importa es saber que el modelo que estás llamando está deliberadamente limitado en un rango estrecho de tareas, por diseño.
Qué significa todo esto: ¿deberías cambiar?
Cambia a Fable 5 para codificación agéntica difícil, tareas de múltiples pasos de largo alcance y razonamiento visual o espacial, donde terminar la tarea vale más que ahorrar centavos por token. Quédate en Opus 4.8 para trabajo de alto volumen sensible al coste, o para cualquier cosa que active el respaldo de todas formas. Ese es el marco completo. El resto es hacer coincidir tu carga de trabajo con el lado correcto de él.
Cuándo Fable 5 gana:
- Codificación agéntica difícil donde Opus 4.8 se detiene; la brecha en SWE-Bench Pro es real
- Tareas de largo alcance (refactorizaciones de múltiples archivos, migraciones) donde la auto-validación da resultados
- Cargas de trabajo de visión y razonamiento espacial
- Cualquier tarea donde una tarea terminada vale más que la prima por token
Cuándo Opus 4.8 sigue ganando:
- Trabajo de alto volumen y coste sensible donde el precio por token domina
- Cargas de trabajo de cyber/bio/química, donde Fable 5 recurre a Opus 4.8 de todas formas, así que llámalo directamente
- Flujos sensibles a la latencia que no pueden tolerar un cambio de modelo a mitad de una tarea
| Caso de uso | Modelo recomendado |
|---|---|
| Codificación agéntica difícil / migraciones | Claude Fable 5 |
| Visión / razonamiento espacial | Claude Fable 5 |
| Clasificación barata de alto volumen | Claude Opus 4.8 |
| Herramientas de seguridad / red-team | Claude Opus 4.8 (directo) |
Sobre disponibilidad: Fable 5 es gratuito en los planes Pro/Max/Team/Enterprise hasta el 22 de junio de 2026, con créditos de uso que se aplican desde el 23 de junio. Está disponible de forma general en la API, AWS Bedrock, GitHub Copilot según el registro de cambios de GitHub y Harvey. Así que puedes probar el cambio en tu editor hoy sin modificar tu facturación.
Sobre el autor
Mert Batur Gurbuz es cofundador de Techsy.io, donde el equipo desarrolla agentes de IA, sistemas de automatización y pipelines de voz/SDR para clientes B2B. Estudia en la Universidad de Birmingham y escribe sobre el stack de herramientas LLM que el equipo de Techsy usa realmente en producción. Conéctate en LinkedIn.
Cofundador, Techsy.io · Universidad de Birmingham
Preguntas frecuentes
¿Qué es Claude Fable 5?
Claude Fable 5 es el primer modelo de clase Mythos disponible públicamente de Anthropic, lanzado el 9 de junio de 2026. Obtiene un 80.3% en SWE-Bench Pro y ejecuta clasificadores de salvaguarda que recurren a Opus 4.8 en consultas de alto riesgo. Cuesta $10 de entrada / $50 de salida por millón de tokens.
¿Cuál es la diferencia entre Fable 5 y Mythos 5?
Son el mismo modelo frontier con diferentes posturas de lanzamiento. Fable 5 es público y está protegido; recurre a Opus 4.8 en consultas peligrosas. Mythos 5 es la versión restringida de capacidad completa, accesible únicamente a través del programa Proyecto Glasswing de Anthropic para defensores e investigadores evaluados.
¿Es Claude Fable 5 realmente mejor que Opus 4.8?
Sí, en codificación agéntica difícil, visión y razonamiento espacial: Fable 5 llega al 80.3% en SWE-Bench Pro frente al 69.2% de Opus 4.8. Pero Opus 4.8 sigue ganando en trabajo de alto volumen sensible al coste, y Fable 5 recurre a Opus 4.8 para temas de alto riesgo de cyber/bio/química de todas formas. "Mejor" depende de tu carga de trabajo.
¿Cuánto cuesta Claude Fable 5?
Claude Fable 5 cuesta $10 por millón de tokens de entrada y $50 por millón de tokens de salida. Anthropic lo enmarca como "menos de la mitad del precio de Mythos Preview". Es aproximadamente 2× Opus 4.8 por token, pero el argumento de valor está en el coste por tarea terminada, ya que Fable 5 completa trabajo que los modelos más baratos no pueden.
¿Qué es un modelo de "clase Mythos"?
Clase Mythos es el nuevo nivel de máxima capacidad de Anthropic, lanzado con Fable 5 y Mythos 5. Representa un salto frontier sobre la línea Opus 4.x en benchmarks de codificación y razonamiento. Fable 5 y Mythos 5 son dos versiones de lanzamiento del mismo modelo de clase Mythos: uno público y con salvaguardas, otro restringido.
¿Por qué Fable 5 recurre a Opus 4.8?
Fable 5 ejecuta clasificadores que detectan solicitudes de alto riesgo (ciberataque ofensivo, bio, química o destilación de modelos) y las redirige a Opus 4.8 en lugar de responder con toda la capacidad de clase Mythos. Esto se activa en menos del 5% de las sesiones. Redujo la tasa de éxito de ataques adversariales del 56.6% (Opus 4.8) al 5.4%.
¿Puedo acceder a Claude Mythos 5?
Probablemente no. Mythos 5 está restringido detrás del Proyecto Glasswing, el programa de acceso evaluado de Anthropic para defensores e investigadores de seguridad que necesitan la capacidad ofensiva completa que Fable 5 bloquea. La mayoría de los desarrolladores no calificarán y no lo necesitan, ya que Fable 5 cubre el trabajo agéntico y de codificación cotidiano.
¿Dónde puedo usar Claude Fable 5?
Claude Fable 5 está disponible de forma general en la API de Anthropic, AWS Bedrock, GitHub Copilot y Harvey. Es gratuito en los planes Pro, Max, Team y Enterprise por puestos hasta el 22 de junio de 2026; los créditos de uso se aplican desde el 23 de junio. Puedes probarlo en tu editor o mediante la API hoy mismo.
Conclusión
Claude Fable 5 es un salto frontier real sobre Opus 4.8: 80.3% frente a 69.2% en SWE-Bench Pro, el doble en FrontierCode y una tasa de éxito de ataques del 5.4% que lo hace mucho más seguro de desplegar con herramientas. Cambia para codificación agéntica difícil, tareas de largo alcance y trabajo con visión. Quédate en Opus 4.8 para volumen sensible al coste o para cualquier cosa que active el respaldo de todas formas. Es gratuito hasta el 22 de junio, así que puedes probar el cambio antes de que te cueste algo. El equipo de Techsy construye agentes de producción exactamente sobre este stack, así que escríbenos si quieres ayuda.