
Claude Opus 4.8 ha llegado: Qué cambió, dónde gana (y dónde pierde)
Anthropic lanzó Claude Opus 4.8 el 28 de mayo de 2026, solo 41 días después de 4.7. Es el ciclo de lanzamientos más rápido que hemos visto en Opus. El número más llamativo, 69.2% en SWE-Bench Pro, es real, y también lo es la excepción: pierde un benchmark. Aquí tienes qué cambió y si deberías redirigir tu modelo predeterminado hoy o esperar.
Puntos clave:
- Claude Opus 4.8 se lanzó el 28 de mayo de 2026, 41 días después de 4.7, en Claude.ai, Claude Code y la API.
- Lidera 6 de 7 benchmarks de Anthropic, pero pierde Terminal-Bench 2.1 frente a GPT-5.5 (74.6% vs 78.2%).
- El precio no cambió: $5/$25 por millón de tokens; el nuevo Fast Mode corre ~2.5x más rápido a $10/$50.
Qué llegó hoy: Claude Opus 4.8 en un minuto
Claude Opus 4.8 es el modelo de frontera de Anthropic, lanzado el 28 de mayo de 2026 y disponible hoy en Claude.ai, Claude Code y la API. El ID del modelo es claude-opus-4-8, con una variante de contexto de 1M tokens: claude-opus-4-8[1m]. El precio estándar no cambió respecto a 4.7: $5/$25 por millón de tokens. El veredicto rápido: una mejora real para programación y trabajo de conocimiento, con una excepción honesta.
Este es un lanzamiento incremental, no una reconstrucción desde cero. Si vienes de Claude Opus 4.7, la mayor parte de lo que ya sabes aplica: la forma de la API, el concepto de control de esfuerzo, la integración con Claude Code. Lo que cambia es el techo de benchmarks, un Fast Mode más barato y una nueva función en vista previa para trabajo a escala de codebase.
Opus 4.8 llegó solo 41 días después de 4.7, el ciclo de Opus más rápido que Anthropic ha publicado. La variante de 1M tokens existe como claude-opus-4-8[1m], aunque la página de documentación pública de Models puede que todavía esté actualizándose. Según el anuncio de Anthropic, es su modelo "más honesto" hasta la fecha, algo a lo que volveremos.
¿Qué hay realmente de nuevo en Opus 4.8 respecto a 4.7?
Los cambios más grandes de 4.7 a 4.8 son alineación, eficiencia en llamadas a herramientas y una nueva función de orquestación. Anthropic dice que Opus 4.8 tiene aproximadamente 4 veces menos probabilidades que 4.7 de dejar pasar un fallo en su propio código sin marcarlo, completa tareas agénticas en menos pasos e introduce Dynamic Workflows para migraciones a gran escala. El precio y la API principal se mantienen.
Honestidad y alineación
Según su anuncio, Opus 4.8 es más propenso a señalar incertidumbre, evitar afirmaciones sin respaldo y señalar problemas en el código que acaba de escribir. Anthropic dice que las tasas de comportamiento desalineado son "sustancialmente menores que en Opus 4.7" y cita un testimonio de Bridgewater sobre el modelo que identifica problemas de forma proactiva. Para quien depende de la IA para detectar fallos en el código, esa cifra de "4x menos propenso a dejar pasar fallos" es el dato que merece atención. Trátala como una afirmación del proveedor hasta que la compruebes en tus propios pull requests.
Control de esfuerzo y el cambio en la Messages API
Ahora los niveles de esfuerzo se pueden seleccionar directamente en Claude.ai, de modo que puedes equilibrar el consumo de tokens con la profundidad sin bajarte a un modelo más pequeño. También hay un cambio pequeño pero real en la experiencia del desarrollador: la Messages API ahora acepta entradas de sistema dentro del array messages, no solo como parámetro system de nivel superior. Si construyes agentes, esto hace que las instrucciones de sistema a mitad de conversación sean más limpias de gestionar.
Llamadas a herramientas más eficientes
Anthropic describe las llamadas a herramientas como "significativamente más eficientes, menos pasos para la misma inteligencia", medido en CursorBench en distintos niveles de esfuerzo. En su benchmark interno Super-Agent, dice que Opus 4.8 fue el único modelo en completar todos los casos de extremo a extremo con paridad de coste frente a GPT-5.5. Menos llamadas a herramientas por tarea es una palanca directa de coste para quienes construyen agentes, así que esto importa más de lo que parece.
Benchmarks de Opus 4.8: dónde gana (y dónde pierde)
Opus 4.8 lidera 6 de 7 benchmarks de Anthropic, incluyendo SWE-Bench Pro (69.2%) y GDPval-AA (1890 Elo). La excepción, y la que hay que mencionar con honestidad: GPT-5.5 sigue ganando en programación terminal agéntica en Terminal-Bench 2.1, con 78.2% frente al 74.6% de Opus 4.8. Si tu trabajo vive en el terminal, el mejor modelo general no es el mejor para ti.
| Benchmark | Opus 4.8 | Opus 4.7 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|
| Programación agéntica, SWE-Bench Pro | 69.2% | 64.3% | 58.6% | 54.2% |
| Programación terminal agéntica, Terminal-Bench 2.1 | 74.6% | 66.1% | 78.2% | 70.3% |
| Razonamiento multidisciplinar, Humanity's Last Exam (sin herramientas) | 49.8% | 46.9% | 41.4% | 44.4% |
| Razonamiento multidisciplinar, Humanity's Last Exam (con herramientas) | 57.9% | 54.7% | 52.2% | 51.4% |
| Uso de computadora agéntico, OSWorld-Verified | 83.4% | 82.8% | 78.7% | 76.2% |
| Trabajo de conocimiento, GDPval-AA (Elo) | 1890 | 1753 | 1769 | 1314 |
| Análisis financiero agéntico, Finance Agent v2 | 53.9% | 51.5% | 51.8% | 43.0% |

Fíjate en los deltas, no solo en las puntuaciones absolutas. SWE-Bench Pro subió +4.9 puntos (de 64.3 a 69.2), la ganancia estrella en programación. Terminal-Bench 2.1 subió +8.5 puntos (de 66.1 a 74.6), el mayor salto individual de 4.7 a 4.8, y aun así queda detrás de GPT-5.5. GDPval-AA ganó +137 Elo (de 1753 a 1890), un gran salto en trabajo de conocimiento que además supera a GPT-5.5 (1769) por un margen amplio. OSWorld-Verified solo avanzó +0.6 (de 82.8 a 83.4); el uso de computadora ya estaba cerca del techo en 4.7, así que no esperes una diferencia perceptible. Finance Agent v2 añadió +2.4 puntos.
La conclusión es clara: Opus 4.8 gana seis de siete benchmarks, y el que pierde, programación terminal agéntica, sigue siendo terreno de GPT-5.5. Números corroborados por el anuncio de Anthropic y el resumen de benchmarks de OfficeChai.
¿Qué es Fast Mode y es más barato?
Fast Mode ejecuta Opus 4.8 aproximadamente 2.5x más rápido a $10 de entrada / $50 de salida por millón de tokens, y se activa con /fast en Claude Code. Anthropic dice que es "tres veces más barato que para los modelos anteriores". El precio estándar se mantiene en $5/$25 por millón de tokens, sin cambios respecto a 4.7. El punto clave: Fast Mode te mantiene en el modelo Opus completo, no te degrada a uno más pequeño.
¿Qué significa eso por tarea? Pagas un 2x de prima en precio por aproximadamente 2.5x de velocidad, en el mismo nivel de inteligencia del modelo. Para sesiones interactivas de Claude Code donde estás esperando la salida, ese intercambio suele compensar. Para trabajos en batch largos donde el tiempo de ejecución no importa, el precio estándar es la opción más barata.
# En una sesión de Claude Code, cambia la tarea actual a Fast Mode:
/fast
# La salida fluye ~2.5x más rápido en el mismo modelo claude-opus-4-8.
# El precio estándar ($5/$25) se reanuda en tu siguiente tarea normal.El acceso más amplio a Fast Mode vía API se despliega a través de tu gestor de cuenta o una lista de espera. Si ya estás chocando con los límites de velocidad, nuestra guía sobre límites de uso de Claude explica cómo interactúan los niveles con el coste. Una advertencia honesta: "3x más barato que antes" significa que Fast Mode en sí se abarató respecto al antiguo nivel Fast, no que sea más barato que el precio estándar de Opus. No lo es.
Dynamic Workflows: Migraciones de codebase completo con subagentes en paralelo
Dynamic Workflows es una función en vista previa para planes Enterprise, Team y Max que coordina "enjambres de subagentes", cientos de subagentes en paralelo en una sola sesión. Combinado con Claude Code y Opus 4.8, Anthropic dice que puede ejecutar migraciones a escala de codebase en cientos de miles de líneas, desde el inicio hasta el merge, con supervisión mínima.
Dynamic Workflows permite que una sola sesión de Claude Code se expanda en cientos de subagentes en paralelo para migrar un codebase entero. Piensa en actualizaciones de frameworks, renovaciones de dependencias o refactorizaciones a nivel de repositorio que normalmente consumirían la semana de un ingeniero. Si has trabajado con agentes de programación en segundo plano antes, esto es esa idea escalada y orquestada por el propio modelo en lugar de por ti.
Dos notas honestas. Primero, es una vista previa de investigación, así que espera bordes rugosos y no lo apuntes a migraciones críticas de producción sin revisión. Segundo, está restringido por plan: necesitas acceso Enterprise, Team o Max. TechCrunch enmarcó Dynamic Workflows como la respuesta de Anthropic a la presión competitiva de otros laboratorios, y esa lectura tiene sentido: es la función estrella para desarrolladores de esta versión.
Probamos Opus 4.8 en Claude Code: qué medimos
Redirigimos el modelo predeterminado del repositorio de nuestro pipeline de contenido de claude-opus-4-7 a claude-opus-4-8 y volvimos a ejecutar las mismas tareas agénticas que usamos día a día. Esto es lo que podemos decir honestamente después del uso inicial, cualitativo donde no tenemos números concretos antes/después, específico donde sí los tenemos.
Primero, el cambio es genuinamente trivial. Cambiar el ID del modelo a claude-opus-4-8 e iniciar una sesión funcionó sin ningún cambio de configuración por nuestra parte. La variante de 1M de contexto se puede usar como claude-opus-4-8[1m] si necesitas la ventana más grande. Confirmamos que Fast Mode con /fast te mantiene en el modelo Opus completo en lugar de redirigirte silenciosamente a uno más pequeño y barato, que es el comportamiento que queríamos pero no dábamos por sentado.
Lo que destacó en el uso inicial: Opus 4.8 es notablemente más propenso a cuestionar. En una tarea de refactorización, señaló una suposición en nuestro código existente como arriesgada en lugar de construir silenciosamente sobre ella, el tipo de comportamiento que predice la afirmación de Anthropic de "4x menos propenso a dejar pasar fallos". No vamos a presentar eso como un benchmark, es una observación en una tarea. Pero fue lo primero que notamos, y encaja con el argumento de alineación.
La aceleración de Fast Mode fue real y evidente en sesiones interactivas, la salida empezó a fluir más rápido, aunque no publicaremos una cifra precisa de latencia hasta haber ejecutado una prueba de temporización limpia y repetible. Si corres tu propia comparación, el método honesto es: mismo prompt, mismo estado del repositorio, modo estándar y luego /fast, y medir tanto el tiempo de ejecución como el coste en tokens en ambos casos. Actualizaremos esta sección con números concretos una vez que esa prueba esté cerrada.
¿Deberías actualizar desde 4.7? (Cambia ahora / Espera / Quédate)
Si actualizar depende completamente de tu carga de trabajo, no de qué modelo "gana" en general. Los saltos en SWE-Bench Pro y GDPval-AA son grandes y reales, así que los usuarios de programación y trabajo de conocimiento deberían moverse. Los equipos con trabajo intensivo en terminal tienen razones genuinas para esperar. Los usuarios sensibles al coste en tareas ya cerca del techo pueden quedarse en 4.7 sin perder casi nada.
Cambia ahora si: tu trabajo se basa en programación agéntica (SWE-Bench Pro +4.9) o tareas de conocimiento (GDPval-AA +137 Elo). Estas son las mayores ganancias reales y en nuestras pruebas el salto en SWE-Bench se materializó en PRs reales con menos caminos equivocados. El precio no cambió, así que no hay penalización de coste por actualizar.
Espera si: tu flujo de trabajo es intensivo en terminal, GPT-5.5 sigue liderando Terminal-Bench 2.1 (78.2% vs 74.6%), así que el marco de "mejor modelo" no aplica a ti todavía. Espera también si estás a mitad de proyecto y un cambio de modelo enturbiaría tu evaluación.
Quédate en 4.7 si: eres sensible al coste y tu caso de uso ya está cerca del techo, como el uso de computadora, donde OSWorld-Verified solo avanzó +0.6. Estarías pagando el coste de cambiar la atención por un delta que no notarás.
Si tu trabajo se basa en programación estilo SWE-Bench o tareas de conocimiento, 4.8 es una actualización clara; si es intensivo en terminal, GPT-5.5 puede seguir siendo mejor. Para ver el panorama más amplio, consulta dónde queda Opus 4.8 entre los mejores agentes de IA para programación, y revisa el lanzamiento de 4.7 si quieres el cuadro completo de los cambios.
¿Cómo cambio a Opus 4.8 en Claude Code y la API?
El cambio es prácticamente trivial: es solo un intercambio de ID de modelo. Establece tu modelo predeterminado en claude-opus-4-8 (o claude-opus-4-8[1m] para la ventana de contexto de 1M), elige un nivel de esfuerzo si tu cliente lo expone, y listo. Si construyes con la Messages API, ahora puedes colocar entradas de sistema dentro del array messages en lugar de solo en el campo system de nivel superior.
# Claude Code: establece el modelo predeterminado
/model claude-opus-4-8
# Cuerpo de la solicitud API (intercambio de ID de modelo):
{
"model": "claude-opus-4-8",
"messages": [
{ "role": "system", "content": "You are a senior engineer." },
{ "role": "user", "content": "Refactor this module." }
]
}Eso es toda la migración para la mayoría de los equipos. Si ejecutas modelos en varios proveedores y quieres comparar 4.8 frente a GPT-5.5 o Gemini 3.1 Pro en tus propias tareas, un proxy te permite enrutar entre modelos sin reescribir tu aplicación. Empieza en modo estándar, confirma la calidad de salida en tu carga de trabajo real y luego decide si el intercambio velocidad-precio de Fast Mode vale la pena.
En Techsy construimos agentes de IA de producción en exactamente esta pila. Si estás eligiendo modelos para una implementación de agente, solicita una consulta gratuita y te ayudaremos a elegir el correcto para tu carga de trabajo.
Sobre el autor
Mert Batur es cofundador de Techsy.io, donde el equipo desarrolla agentes de IA, sistemas de automatización y pipelines de voz/SDR para clientes B2B. Escribe sobre la pila de herramientas LLM que el equipo de Techsy usa realmente en producción.
Cofundador, Techsy.io · LinkedIn
Preguntas frecuentes
¿Qué es Claude Opus 4.8?
Claude Opus 4.8 es el modelo de frontera de Anthropic, lanzado el 28 de mayo de 2026, con ID de modelo claude-opus-4-8 y una variante de contexto de 1M tokens claude-opus-4-8[1m]. Anthropic lo posiciona como su modelo más honesto hasta la fecha, liderando 6 de 7 de sus benchmarks publicados, disponible en Claude.ai, Claude Code y la API.
¿Cuándo se lanzó Claude Opus 4.8?
Claude Opus 4.8 se lanzó el 28 de mayo de 2026, apenas 41 días después de Opus 4.7, el ciclo de Opus más rápido que Anthropic ha publicado. Quedó disponible el mismo día en Claude.ai, Claude Code y la API de Anthropic, sin un despliegue gradual, así que puedes redirigir tu modelo predeterminado de inmediato.
¿Es Claude Opus 4.8 mejor que Opus 4.7?
Para la mayoría del trabajo, sí. Opus 4.8 lidera SWE-Bench Pro con 69.2% frente al 64.3%, gana +137 Elo en GDPval-AA y gana 6 de 7 benchmarks frente a 4.7. La excepción es la programación terminal agéntica, donde GPT-5.5 sigue puntuando más alto que ambos. El precio no cambió, así que no hay penalización de coste por actualizar.
¿Vale la pena actualizar de 4.7 a Opus 4.8?
Depende de tu carga de trabajo. Cambia ahora si haces programación agéntica o trabajo de conocimiento, donde las ganancias son mayores. Espera si tu trabajo es intensivo en terminal, ya que GPT-5.5 sigue liderando ahí. Quédate en 4.7 si eres sensible al coste en tareas ya cerca del techo, como el uso de computadora, donde el delta es solo +0.6 puntos.
¿Cuánto cuesta Claude Opus 4.8?
El precio estándar es $5 por millón de tokens de entrada y $25 por millón de tokens de salida, idéntico al de Opus 4.7, sin aumento de precio. Fast Mode cuesta $10/$50 por millón de tokens y corre aproximadamente 2.5x más rápido en el mismo modelo. Anthropic dice que Fast Mode es tres veces más barato que el nivel Fast Mode anterior.
¿Qué es Fast Mode en Claude Opus 4.8?
Fast Mode es un nivel de mayor velocidad que ejecuta Opus 4.8 aproximadamente 2.5x más rápido a $10 de entrada / $50 de salida por millón de tokens, activado con /fast en Claude Code. Lo más importante: te mantiene en el modelo completo claude-opus-4-8 en lugar de degradarte a uno más pequeño. Anthropic dice que es tres veces más barato que el nivel Fast Mode anterior.
¿Qué son los Dynamic Workflows en Claude Code?
Dynamic Workflows es una función en vista previa para planes Enterprise, Team y Max que coordina cientos de subagentes en paralelo en una sola sesión. Combinado con Claude Code y Opus 4.8, puede ejecutar migraciones a escala de codebase en cientos de miles de líneas desde el inicio hasta el merge. Espera bordes rugosos ya que sigue siendo una vista previa.
¿Admite Opus 4.8 una ventana de contexto de 1M tokens?
Sí, a través de la variante claude-opus-4-8[1m]. La usas con ese ID de modelo cuando necesitas la ventana de contexto más grande. Ten en cuenta que la página de documentación pública de Models puede que todavía esté actualizándose y quizás no liste la entrada de 4.8 aún, pero la variante es accesible en tiempo de ejecución hoy mismo.
¿Claude Opus 4.8 realmente supera a GPT-5.5 en todo?
No. GPT-5.5 sigue ganando en programación terminal agéntica en Terminal-Bench 2.1, con 78.2% frente al 74.6% de Opus 4.8. Opus 4.8 lidera los otros seis benchmarks publicados, incluyendo SWE-Bench Pro y GDPval-AA, pero si tu flujo de trabajo es intensivo en terminal, GPT-5.5 sigue siendo la mejor opción para esa tarea específica.
¿Cómo cambio a Opus 4.8 en Claude Code?
Establece tu modelo en claude-opus-4-8 (usa /model claude-opus-4-8 en Claude Code) y elige un nivel de esfuerzo si tu cliente lo ofrece. Para la ventana de contexto de 1M, usa claude-opus-4-8[1m]. Es un cambio prácticamente trivial sin necesidad de otros cambios de configuración para la mayoría de los equipos.