
Claude Opus 5 Ya Está Aquí: Inteligencia Casi de Fable 5 a Mitad de Precio
Anthropic lanzó Claude Opus 5 el 24 de julio de 2026, y la propuesta es directa: inteligencia fronteriza cercana a la de Fable 5, a mitad de precio. La prueba estrella es Frontier-Bench v0.1, donde Opus 5 alcanza un 43,3 % y más que duplica el 21,1 % de Opus 4.8. La pega, porque siempre hay una: no lo gana todo. GPT-5.6 Sol sigue superándolo en un test de codificación agéntica, y en salud y biología la corona es de Mythos 5. Esto es lo que realmente cambió, la tabla completa de benchmarks y si deberías cambiar tu modelo predeterminado hoy mismo.
Puntos clave:
- Claude Opus 5 se lanzó el 24 de julio de 2026 en la API de Claude, Claude.ai, Claude Code y Claude Cowork, con el ID de modelo
claude-opus-5. - Lidera la mayoría de los benchmarks publicados por Anthropic (Frontier-Bench, GDPval-AA, ARC-AGI-3, OSWorld 2.0, AutomationBench), pero queda por detrás en un par de tests de codificación, derecho y ciencia.
- El precio no cambia respecto a Opus 4.8: 5 $/25 $ por millón de tokens, con un modo Fast a aproximadamente 2x el precio para unas 2,5x la velocidad.
Lo Que Se Lanzó Hoy: Claude Opus 5 en Un Minuto
Claude Opus 5 es el nuevo modelo fronterizo de Anthropic, publicado el 24 de julio de 2026 y disponible ese mismo día en la API, Claude.ai, Claude Code y Claude Cowork. El ID de modelo es claude-opus-5. El encuadre de Anthropic, según el anuncio, es que "se acerca a la inteligencia fronteriza de Claude Fable 5 a mitad de precio". El precio estándar se mantiene en 5 $ de entrada / 25 $ de salida por millón de tokens, igual que Opus 4.8.
Esto es un salto generacional real para el trabajo con agentes, no una actualización menor. Si vienes de Claude Opus 4.8, la forma de la API y la integración con Claude Code se mantienen sin cambios, así que la migración es un simple cambio de ID de modelo. Lo que cambia es el techo: en Frontier-Bench v0.1, Anthropic afirma que Opus 5 más que duplica la puntuación de 4.8 con un menor coste por tarea, y publica cifras de referencia en GDPval-AA y ARC-AGI-3.
El posicionamiento importa. Fable 5 es el modelo fronterizo más caro de Anthropic. Acercarse a su nivel a precio de Opus es toda la historia de este lanzamiento, y por eso la frase "a mitad de precio" es la que Anthropic usa como titular.
¿Qué Hay Realmente de Nuevo en Opus 5 vs 4.8?
El mayor cambio de 4.8 a 5 es el criterio: Opus 5 es notablemente mejor verificando su propio trabajo e iterando hasta que una tarea está realmente terminada, no solo aparentemente acabada. Anthropic también cita una ingeniería de software más sólida, trabajo de conocimiento y investigación científica, además de una salida visual mejorada. El precio y la API principal no se movieron.
Mejor criterio y autoverificación
El cambio de comportamiento más claro es que Opus 5 se verifica a sí mismo. Anthropic cita a Zimu Li, miembro del personal técnico, describiendo el modelo como uno que "verifica ramas, comprueba plantillas" en lugar de avanzar a ciegas. Para cualquiera que dependa de un agente para detectar sus propios errores en producción, ese es el rasgo que marca la diferencia. También es lo más difícil de vender en una tabla de benchmarks, así que trátalo como una afirmación que debes probar con tus propias tareas.
Inteligencia fronteriza a coste de Opus
Sualeh Asif, cofundador de Cursor, resumió el lanzamiento como "inteligencia casi de Fable 5 a velocidad y coste de Opus". Esa es la lectura práctica: los equipos que querían razonamiento de clase Fable 5 pero no podían justificar el precio ahora tienen una opción intermedia. En OSWorld 2.0, Anthropic dice que Opus 5 supera a Fable 5 con aproximadamente un tercio del coste, que es el ejemplo más limpio del argumento de valor.
Postura de alineación y seguridad
Anthropic reporta que Opus 5 tiene su puntuación más baja de comportamiento desalineado hasta la fecha (2,3) y lo llama el modelo más alineado con su Constitución. En el lado de seguridad, los clasificadores de ciberseguridad se describen como aproximadamente un 85 % menos restrictivos que los de Fable 5, con un Programa de Verificación Cibernética empresarial para equipos que lo necesiten. Como con cualquier afirmación de seguridad de un proveedor, útil de saber, pero sigue valiendo la pena validarla contra tus propios casos de red team.
Benchmarks de Opus 5: Dónde Gana (y Dónde Pierde)
Opus 5 lidera la mayoría de los benchmarks publicados por Anthropic, y las victorias que importan para quienes construyen agentes son contundentes: Frontier-Bench v0.1 (43,3 %), GDPval-AA (1861 Elo), ARC-AGI-3 (30,2 %), OSWorld 2.0 (70,6 %) y AutomationBench de Zapier (26,0 %). Las excepciones honestas: GPT-5.6 Sol gana DeepSWE v1.1, Fable 5 supera por poco en FrontierCode y los tests legales, y Mythos 5 se lleva salud y biología.
| Benchmark | Opus 5 | Fable 5 | Opus 4.8 | GPT-5.6 Sol |
|---|---|---|---|---|
| Codificación agéntica en terminal, Frontier-Bench v0.1 | 43,3 % | 33,7 % | 21,1 % | 34,4 % |
| Trabajo de conocimiento, GDPval-AA v2 (Elo) | 1861 | 1747 | 1593 | 1736 |
| Resolución de problemas novedosos, ARC-AGI-3 | 30,2 % | — | 1,5 % | 7,8 % |
| Búsqueda agéntica, BrowseComp | 90,8 % | 87,4 % | 84,3 % | 90,4 % |
| Razonamiento multidisciplinar, Humanity's Last Exam (con herramientas) | 64,7 % | 63,9 % | 57,9 % | — |
| Uso agéntico del ordenador, OSWorld 2.0 | 70,6 % | 66,1 % | 55,7 % | 62,6 % |
| Codificación agéntica, DeepSWE v1.1 | 68,8 % | 69,7 % | 59,0 % | 72,7 % |
| Codificación agéntica, FrontierCode v1.1 (Main) | 53,4 % | 53,5 % | 46,5 % | 47,5 % |
| Flujos de trabajo empresariales, AutomationBench | 26,0 % | 17,4 % | 17,0 % | 18,1 % |
| Legal Agent Benchmark (reservado) | 11,7 % | 13,3 % | 10,4 % | 2,5 % |
| Salud, HealthBench Professional | 59,8 % | 66,0 % | 57,4 % | 60,5 % |
| Biología, BioMysteryBench (difícil) | 49,4 % | 46,5 % | 42,4 % | — |

Lee los deltas, no solo las puntuaciones absolutas. Frontier-Bench saltó +22,2 puntos sobre Opus 4.8 (de 21,1 a 43,3), el mayor salto individual y la razón por la que Anthropic llama a esto un lanzamiento de codificación y agentes. GDPval-AA ganó +268 Elo (de 1593 a 1861), superando a todos los modelos de la tabla en trabajo de conocimiento. ARC-AGI-3 es el que llama la atención: 30,2 % frente al 7,8 % de GPT-5.6 Sol y el 1,5 % de Opus 4.8, que Anthropic enmarca como aproximadamente 3x el siguiente mejor modelo público en resolución de problemas novedosos. En AutomationBench, 26,0 % es aproximadamente 1,5x el resto del campo, una señal directa para quien construye agentes de procesos de negocio.
Dos notas honestas sobre las derrotas. Primera: el líder en la columna de Fable 5 para salud (66,0 %) y la división de biología resuelta por humanos es en realidad Mythos 5, el modelo especializado en ciencia de Anthropic, no Fable 5, así que esas no son victorias comparables entre modelos generales. Segunda: el panorama de codificación está genuinamente dividido: GPT-5.6 Sol se lleva DeepSWE v1.1 (72,7 % vs 68,8 %) y Fable 5 gana FrontierCode por un pelo (53,5 % vs 53,4 %). Si tu trabajo es puramente codificación estilo SWE-bench, la etiqueta de "mejor en general" no elige automáticamente a Opus 5.
¿Cuánto Cuesta Opus 5? Precios y Modo Fast
El precio estándar de Opus 5 es 5 $ por millón de tokens de entrada y 25 $ por millón de tokens de salida, idéntico a Opus 4.8 según los precios publicados de Anthropic, así que no hay subida de precio por la actualización. La afirmación de "mitad de precio" es relativa a Fable 5, no a 4.8: obtienes inteligencia casi de Fable 5 sin pagar las tarifas de Fable 5. El modo Fast funciona a aproximadamente 2x el precio base para unas 2,5x la velocidad predeterminada, y la API soporta enrutamiento con respaldo.
¿Y qué significa eso por tarea? Con el precio estándar no pagas nada extra respecto a 4.8 y obtienes un salto de capacidad enorme, lo que hace que la actualización sea prácticamente gratuita para la mayoría de cargas de trabajo. El modo Fast es la palanca para sesiones interactivas: cambias un sobreprecio de 2x por una salida que se transmite unas 2,5x más rápido en el mismo modelo, lo que compensa cuando estás ahí esperando y duele cuando ejecutas lotes nocturnos donde el tiempo real es irrelevante. Si los límites de tasa son tu restricción real, nuestra guía sobre límites de uso de Claude cubre cómo interactúan los niveles con el coste.
# Claude Code: point your default model at Opus 5
/model claude-opus-5
# API request body (model ID swap):
{
"model": "claude-opus-5",
"messages": [
{ "role": "user", "content": "Refactor this module and verify the tests pass." }
]
}Dónde Encaja Opus 5 para Agentes en Producción
Las ganancias se concentran exactamente donde viven los agentes en producción: codificación en terminal (Frontier-Bench), uso del ordenador (OSWorld 2.0), búsqueda agéntica (BrowseComp) y flujos de trabajo empresariales multi-paso (AutomationBench). Esas cuatro son las cargas de trabajo que más se rompen en despliegues reales, así que un modelo que salta en las cuatro a la vez cambia lo que es viable publicar.
Esa es la parte que merece reflexión. Un benchmark como AutomationBench mide si un agente puede completar un flujo de trabajo real con múltiples herramientas de principio a fin, y el 26,0 % de Opus 5 frente a aproximadamente un 17 % del resto del campo es la diferencia entre "funciona bien en la demo" y "sobrevive al contacto con un CRM desordenado". El resultado de OSWorld 2.0 (70,6 %, superando a Fable 5 con un tercio del coste) dice lo mismo para agentes de uso de ordenador que hacen clic en software real. Para equipos que publican agentes de IA de cara al cliente, esas son las cifras que se traducen en menos fallos a las 2 de la mañana.
También reduce el coste de un patrón de diseño que usamos mucho: la autoverificación barata. Cuando el modelo es genuinamente mejor comprobando sus propias ramas, puedes gastar menos tokens en un paso de crítico separado y seguir detectando los mismos errores. Eso es una línea de presupuesto real para cualquiera que ejecute agentes a volumen.
Cómo Estamos Integrando Opus 5 en Nuestro Stack
En Techsy construimos y operamos agentes de IA en producción sobre el stack de Claude, así que un lanzamiento fronterizo es una evaluación el mismo día, no un titular que leemos y olvidamos. Aquí va nuestra primera lectura honesta, cualitativa donde aún no tenemos cifras limpias de antes/después, específica donde sí las tenemos.
El cambio en sí es trivial, y ese es el punto. Nuestros pipelines de contenido y automatización fijan un modelo predeterminado en configuración; cambiar claude-opus-4-8 a claude-opus-5 y reiniciar una sesión no requirió ningún otro cambio, igual que cada actualización reciente de Opus. Si enrutas entre proveedores y quieres hacer A/B de Opus 5 contra Fable 5 o GPT-5.6 Sol en tus propias tareas, un proxy te permite cambiar de modelo sin reescribir tu app.
Lo que estamos vigilando primero es la afirmación de autoverificación, porque es la que realmente cambiaría nuestra arquitectura. Nuestros agentes actuales ejecutan un paso de crítico explícito para detectar ediciones erróneas antes de que se apliquen; si Opus 5 señala de forma fiable sus propias ramas débiles, podemos reducir ese paso y ahorrar tokens. No publicaremos una cifra sobre eso hasta haberlo ejecutado en un conjunto de tareas repetible, la misma disciplina que esperaríamos de cualquiera que cite métricas de agentes. Si quieres el método, es el de nuestra guía para evaluar agentes de IA en producción: mismos prompts, mismo estado del repositorio, contar los giros erróneos, no las sensaciones.
¿Deberías Cambiar Desde Opus 4.8? (Cambiar / Esperar / Quedarte)
Si conviene moverse depende de tu carga de trabajo, no de qué modelo "gana" en general. Los saltos en trabajo agéntico y de conocimiento son grandes y reales, así que la mayoría de equipos deberían cambiar. Los equipos de codificación pura con un pipeline de GPT o Fable tienen motivo para probar antes de comprometerse, y los usuarios cerca del techo en tareas baratas pueden quedarse sin perder casi nada.
Cambia ahora si: tu trabajo depende de tareas agénticas, uso del ordenador, automatización de procesos de negocio o trabajo de conocimiento. Frontier-Bench (+22,2 sobre 4.8), AutomationBench (~1,5x el campo) y GDPval-AA (+268 Elo) son las mayores ganancias reales, y el precio no cambió, así que no hay penalización de coste por actualizar.
Espera si: tu flujo de trabajo es puramente codificación agéntica y ya usas GPT-5.6 Sol o Fable 5 para eso. GPT-5.6 Sol sigue liderando DeepSWE v1.1 y Fable 5 supera por poco en FrontierCode, así que ejecuta tu propia evaluación de codificación antes de cambiar. También espera si estás a mitad de un proyecto y un cambio de modelo enturbiaría una evaluación que ya estás ejecutando.
Quédate en 4.8 si: te importa el coste en tareas que ya estaban cerca del techo para ti y no tocas las cargas de trabajo agénticas donde Opus 5 se adelanta. Estarías pagando un coste de cambio por un delta que no vas a notar. Para el panorama más amplio, mira cómo se comparan los modelos en nuestro análisis de Claude Sonnet 5 y la visión general de Fable 5 y Mythos 5.
Elegimos y conectamos modelos así para construcciones de agentes de clientes cada semana. Si estás decidiendo qué modelo estandarizar para un agente en producción, obtén una consulta gratuita y te ayudamos a emparejar el modelo con la carga de trabajo en lugar de con el marketing.
Sobre el Autor
Mert Batur Gurbuz es Cofundador de Techsy.io, donde el equipo publica agentes de IA, sistemas de automatización y pipelines de voz/SDR para clientes B2B. Estudia en la Universidad de Birmingham y escribe sobre el stack de herramientas LLM que el equipo de Techsy realmente ejecuta en producción.
Cofundador, Techsy.io, Universidad de Birmingham · LinkedIn
Preguntas Frecuentes
¿Qué es Claude Opus 5?
Claude Opus 5 es el modelo fronterizo de Anthropic, publicado el 24 de julio de 2026, con el ID de modelo claude-opus-5. Anthropic lo posiciona como cercano a la inteligencia de Fable 5 a mitad de precio, y lidera la mayoría de sus benchmarks publicados, incluyendo Frontier-Bench, GDPval-AA y ARC-AGI-3. Está disponible en la API de Claude, Claude.ai, Claude Code y Claude Cowork.
¿Cuándo se lanzó Claude Opus 5?
Claude Opus 5 se lanzó el 24 de julio de 2026. Estuvo disponible ese mismo día en la API de Claude, Claude.ai, Claude Code y Claude Cowork, sin despliegue escalonado, así que puedes cambiar tu modelo predeterminado a claude-opus-5 de inmediato.
¿Es Claude Opus 5 mejor que Opus 4.8?
Para la mayoría del trabajo, sí. Opus 5 más que duplica a Opus 4.8 en Frontier-Bench v0.1 (43,3 % vs 21,1 %), gana 268 Elo en GDPval-AA y salta del 1,5 % al 30,2 % en ARC-AGI-3. El precio no cambia, así que no hay penalización de coste. Las excepciones son algunos tests de codificación y ciencia donde GPT-5.6 Sol, Fable 5 o Mythos 5 siguen liderando.
¿Cuánto cuesta Claude Opus 5?
El precio estándar es 5 $ por millón de tokens de entrada y 25 $ por millón de tokens de salida, idéntico a Opus 4.8. La frase "mitad de precio" se refiere a Fable 5, no a 4.8: Opus 5 ofrece inteligencia casi de Fable 5 a tarifas de Opus. El modo Fast cuesta aproximadamente 2x el precio base y funciona unas 2,5x más rápido en el mismo modelo.
¿Supera Claude Opus 5 a Fable 5?
No en todo. Opus 5 supera a Fable 5 en OSWorld 2.0, BrowseComp, GDPval-AA y Frontier-Bench, y lo hace a una fracción del precio de Fable 5. Pero Fable 5 sigue superando por poco en FrontierCode y el benchmark legal, y Mythos 5 (el modelo de ciencia de Anthropic) lidera en salud y biología. La propuesta es "casi Fable 5 a mitad de precio", no "mejor que Fable 5 en todo".
¿En qué pierde Opus 5?
GPT-5.6 Sol gana en codificación agéntica en DeepSWE v1.1 (72,7 % vs 68,8 %), Fable 5 gana FrontierCode v1.1 por 0,1 puntos y el benchmark legal reservado (13,3 % vs 11,7 %), y Mythos 5 lidera HealthBench Professional y los tests de biología. Si tu carga de trabajo está dominada por alguno de esos, haz un benchmark antes de cambiar.
¿Es Claude Opus 5 bueno para construir agentes de IA?
Está diseñado para eso. Las mayores ganancias están en codificación agéntica en terminal (Frontier-Bench), uso del ordenador (OSWorld 2.0), búsqueda agéntica (BrowseComp) y flujos de trabajo empresariales multi-paso (AutomationBench), que son las cargas de trabajo que ejecutan los agentes en producción. Su autoverificación más fuerte también te permite gastar menos tokens en un paso de crítico separado.
¿Cómo cambio a Opus 5 en Claude Code y la API?
Establece tu modelo a claude-opus-5 (usa /model claude-opus-5 en Claude Code) y listo para la mayoría de equipos. En la API, cambia el campo model a claude-opus-5; la forma de la petición no cambia respecto a Opus 4.8, así que no se necesitan otros cambios de código.
¿Qué es el modo Fast en Claude Opus 5?
El modo Fast es un nivel de mayor velocidad que ejecuta Opus 5 a aproximadamente 2,5x la velocidad predeterminada por unas 2x el precio estándar. Te mantiene en el modelo completo claude-opus-5 en lugar de enrutar a uno más pequeño, lo que lo hace útil para sesiones interactivas donde estás esperando la salida y no vale la pena para trabajos por lotes donde la latencia es irrelevante.