ai-machine-learning

Claude Opus 4.7: 87,6 % en SWE-bench — ¿merece la actualización?

Escrito por Mert Batur
Actualizado May 12, 2026
22 lectura
Claude Opus 4.7: 87,6 % en SWE-bench — ¿merece la actualización?

Qué hay de nuevo en Claude Opus 4.7: Benchmarks, /ultrareview y la capa de seguridad Mythos (abril 2026)

Claude Opus 4.7 se lanzó el 16 de abril de 2026 con SWE-bench Verified en 87,6%, SWE-bench Pro en 64,3% y precios sin cambios: $5 de entrada / $25 de salida por millón de tokens. Hay tres novedades que van a cambiar tu día a día: xhigh es el nuevo nivel de esfuerzo predeterminado en Claude Code, /ultrareview es un comando de revisión de código multietapa completamente nuevo, y Mythos Preview — el modelo hermano anunciado el 7 de abril — es la razón por la que Opus 4.7 es el primer Claude en salir con la nueva capa de seguridad post-Mythos de Anthropic. Aquí tienes el resumen completo, los números y la lista de verificación para la migración.

Resumen rápido — Qué se lanzó hoy

  • Lanzamiento: Disponible de forma general el 16 de abril de 2026 (Claude.ai, API, Claude Code, Amazon Bedrock, Google Cloud Vertex AI, Microsoft Foundry)
  • Precio: Sin cambios — $5 por millón de tokens de entrada, $25 por millón de tokens de salida
  • SWE-bench Pro: 64,3% (era 53,4% en Opus 4.6) — supera a GPT-5.4 Pro (57,7%) y Gemini 3.1 Pro (54,2%)
  • SWE-bench Verified: 87,6% (era 80,8%)
  • CursorBench: 70% (era 58%)
  • Nuevo: nivel de esfuerzo xhigh — ahora el predeterminado de Claude Code en todos los planes
  • Nuevo: comando /ultrareview — revisión de código multietapa que se ejecuta en segundo plano
  • Beta pública: Presupuestos de tareas — limita el gasto en dólares de tareas agénticas de larga duración
  • Mythos Preview es el modelo hermano de acceso limitado que impulsó los nuevos mecanismos de seguridad de la versión 4.7
  • Requisito de Claude Code: v2.1.111 o superior — ejecuta claude update
  • Cambio de predeterminado: La API Enterprise y pago por uso pasa de 4.6 a 4.7 el 23 de abril de 2026

¿Qué hay de nuevo en Claude Opus 4.7?

Claude Opus 4.7 se lanzó el 16 de abril de 2026 con el nuevo nivel de esfuerzo xhigh (el nuevo predeterminado de Claude Code), el comando /ultrareview para revisiones de código multietapa, la función de presupuestos de tareas en beta pública y un tokenizador actualizado. SWE-bench Pro sube al 64,3%; el precio se mantiene en $5 / $25 por millón de tokens.

Aquí tienes todos los cambios que importan, en una sola tabla:

FunciónQué haceDónde se lanza
Nivel de esfuerzo xhighNuevo nivel entre high y max; presupuesto de razonamiento adaptativoAPI + Claude Code (predeterminado)
/ultrareviewRevisión de código multietapa (seguridad, estilo, lógica, pruebas) en segundo planoClaude Code 2.1.111+
Presupuestos de tareas (beta)Limita el gasto en tokens de un agente de larga ejecuciónAPI + Claude Code
Modo automático extendidoEl modelo asigna el esfuerzo de razonamiento por sí mismoUsuarios del nivel Max
Resolución de visiónLímite de entrada elevado a 2.576 px (~3,75 MP, 3× antes)API + Claude.ai
Tokenizador actualizadoProduce 1,0-1,35× más tokens según el contenidoTodos los endpoints
Memoria entre sesionesBasada en el sistema de archivos; recuerda las convenciones del proyectoClaude Code
Seguimiento de instruccionesInterpretación literal más estricta de los promptsTodos los endpoints

Los tres que vas a notar primero son xhigh, /ultrareview y los presupuestos de tareas. Anthropic convirtió xhigh en el predeterminado de Claude Code porque sus evaluaciones internas mostraron que es el punto óptimo entre calidad y latencia para el coding agéntico — no porque sea el martillo más grande. /ultrareview es un comando completamente nuevo que ejecuta pasadas de revisión separadas con contexto dedicado para cada etapa, de modo que tu pasada de "¿nos falta un null check?" no compite por contexto con tu pasada de "¿esto sigue nuestra configuración de lint?". Los presupuestos de tareas en beta pública te permiten decir: ejecuta este agente de migración y detente cuando hayas consumido $10 de tokens de Opus 4.7.

Hay dos cambios más sutiles que pueden pillarte por sorpresa. Primero, el tokenizador actualizado produce 1,0-1,35× más tokens para el mismo contenido, lo que significa que el mismo prompt que te costaba $2,50 en la versión 4.6 podría costarte hasta $3,38 en la 4.7. Segundo, el seguimiento de instrucciones de Opus 4.7 es notablemente más estricto — los prompts que dependían de que la versión 4.6 interpretara de forma laxa términos como "más o menos" o "aproximadamente" obtendrán resultados más literales. Anthropic señala ambos cambios en las notas oficiales de la versión. Presupuesta en consecuencia y revisa tu biblioteca de prompts antes del cambio de predeterminado del 23 de abril.

Benchmarks — Opus 4.7 vs 4.6 vs 4.5 (y GPT-5.4 y Gemini 3.1 Pro)

Claude Opus 4.7 obtiene 87,6% en SWE-bench Verified (subiendo desde 80,8%), 64,3% en SWE-bench Pro (subiendo desde 53,4%) y 70% en CursorBench (subiendo desde 58%). Supera a GPT-5.4 Pro (57,7%) y Gemini 3.1 Pro (54,2%) en SWE-bench Pro, y empata estadísticamente en GPQA Diamond con ambos competidores.

Vamos a desglosar estos números, porque un salto de 6,8 puntos en SWE-bench Verified suena árido hasta que recuerdas que representa pull requests reales que la versión 4.6 no podía cerrar limpiamente.

BenchmarkOpus 4.5Opus 4.6Opus 4.7GPT-5.4 ProGemini 3.1 Pro
SWE-bench Verified80,8%87,6%
SWE-bench Pro53,4%64,3%57,7%54,2%
GPQA Diamond94,2%94,4%94,3%
CursorBench58%70%
Agudeza visual (XBOW)54,5%98,5%

"SWE-bench Pro: Claude Opus 4.7 vs competidores"

Tabla de datos
"SWE-bench Pro: Claude Opus 4.7 vs competidores"
"Modelo""SWE-bench Pro"
"Opus 4.6"53.4
"GPT-5.4 Pro"57.7
"Gemini 3.1 Pro"54.2
"Opus 4.7"64.3

Coding. SWE-bench Pro es el titular — un salto de 10,9 puntos sobre la versión 4.6 y una ventaja de 6,6 puntos sobre GPT-5.4 Pro. En Rakuten-SWE-Bench, Anthropic informa que se resolvieron 3× más tareas de producción. CodeRabbit muestra +10 puntos porcentuales de recall. Un benchmark interno de 93 tareas resolvió un 13% más de tareas, incluidas 4 que ni Opus 4.6 ni Sonnet 4.6 podían resolver. Si ya has leído nuestro análisis comparativo de Claude Code vs Cursor vs Copilot, ya sabes que CursorBench es una prueba de ediciones prácticas en codebases reales — pasar del 58% al 70% es, en la práctica, más útil que los números de SWE-bench.

Razonamiento. GPQA Diamond con 94,2% queda estadísticamente empatado con GPT-5.4 Pro (94,4%) y Gemini 3.1 Pro (94,3%). Ahora mismo estamos ante una frontera de tres vías.

Visión. XBOW pasó del 54,5% al 98,5% — básicamente saturación. El límite de entrada de imágenes es ahora 2.576 px en el lado largo, aproximadamente 3,75 megapíxeles, más de 3× el de los modelos Claude anteriores.

Agente financiero. Nuevo estado del arte (línea base: 60,7% de la versión 4.6).

Advertencia honesta. El propio Anthropic señala en las notas de la versión las limitaciones de BrowseComp — ningún benchmark individual debería tomarse como evangelio, y nosotros tampoco lo hacemos.

Probando Opus 4.7 High (modo de razonamiento extendido)

El modo de razonamiento extendido de Claude Opus 4.7 deja que el modelo decida cuánto razonar antes de responder. Se lanza con cuatro niveles de esfuerzo: medium, high, xhigh (nuevo) y max. xhigh es ahora el predeterminado en Claude Code — supera a high en tareas de depuración difíciles con aproximadamente un 30-50% más de tokens de razonamiento y 2× la latencia de high, pero cuesta mucho menos que max.

Piensa en los niveles de esfuerzo como ejecutar un motor de ajedrez a profundidad 12 vs profundidad 20. Más profundidad = mejores movimientos, pero relojes mucho más largos. En las versiones 4.5 y 4.6, elegías un presupuesto de tokens de antemano. En la 4.7, el modelo se autoasigna dentro del nivel de esfuerzo que hayas elegido — ese es el cambio real.

EsfuerzoIdeal paraLatencia (relativa)Impacto en costo de tokensDelta de calidad vs high
mediumChat interactivo, correcciones rápidasBase
highTareas de coding estándar~1,5×+10-20%+3-5pp en SWE-bench
xhigh (nuevo predeterminado)Coding agéntico, tareas de largo horizonte~2,5×+25-40%+5-8pp en SWE-bench
maxDepuración más difícil, I+D4-6×+50-80%+1-2pp sobre xhigh

Sinceramente, que xhigh sea el predeterminado es el titular aquí. Boris Cherny (Anthropic) confirmó en Threads que los datos de evaluación interna mostraban xhigh como el punto óptimo entre calidad y latencia para el coding agéntico — por eso Claude Code ya no te pregunta. En nuestra prueba, xhigh terminó consistentemente una refactorización multifichero en una sola pasada donde high necesitaba dos iteraciones. max obtuvo ganancias marginales en un bug de concurrencia complejo pero triplicó aproximadamente el tiempo de espera. Tus resultados pueden variar, pero esa es la forma que observamos.

Configurarlo en la API es un parámetro de una sola línea:

python
from anthropic import Anthropic

client = Anthropic()

message = client.messages.create(
    model="claude-opus-4-7",
    max_tokens=4096,
    thinking={"type": "enabled", "budget_tokens": 16000},  # xhigh-equivalent
    messages=[{"role": "user", "content": "Refactor this function..."}]
)

En Claude Code, fíjalo con claude --model opus --effort xhigh o exporta ANTHROPIC_EFFORT=xhigh. Si necesitas la referencia completa, consulta cómo configurar qué modelo usa Claude Code y la documentación oficial de configuración de modelos de Claude Code.

Un problema a tener en cuenta: mayor esfuerzo = más tokens de razonamiento = costos que se acumulan, y el tokenizador actualizado de la versión 4.7 ya infla los recuentos de tokens 1,0-1,35×. Si eres sensible al costo, combina xhigh con estrategias agresivas de caché de prompts — lo cubrimos en detalle — y presupuesta en el punto medio de 1,2×. Más sobre las matemáticas del dinero a continuación.

Actualizaciones de Claude Code — /ultrareview, presupuestos de tareas y coworking agéntico

Claude Code 2.1.111 incorpora soporte para Opus 4.7, el nuevo comando /ultrareview para revisión de código multietapa, presupuestos de tareas (beta pública) para limitar el gasto en agentes de larga ejecución, xhigh como nivel de esfuerzo predeterminado y memoria entre sesiones mejorada basada en el sistema de archivos. GitHub Copilot (Pro+/Business/Enterprise) obtiene Opus 4.7 con un multiplicador de solicitudes premium de 7,5× hasta el 30 de abril.

Aquí está la parte interesante: /ultrareview ejecuta esas pasadas de revisión en segundo plano mientras tú sigues programando. No estás bloqueado esperando el veredicto. Donde el simple /review hace una sola pasada con un único contexto de revisor, /ultrareview arranca pasadas dedicadas para seguridad, estilo, lógica y pruebas — cada una obtiene su propia ventana de contexto, lo que significa que el revisor de estilo no está distraído por "¿espera, esto es inyección SQL?". Pasamos la primera hora después del lanzamiento ejecutándolo en tres PRs internos, y la diferencia que más destacó fue que la pasada de pruebas identificó específicamente cobertura faltante de casos límite que /review había pasado por alto en silencio.

Los presupuestos de tareas son el otro gran cambio. Puedes limitar un agente de largo horizonte a $10, $50, lo que sea — el agente se detiene cuando alcanza el límite. Si has estado ejecutando scripts de migración o agentes de refactorización preocupándote por la factura, esta es la función. Ningún competidor la está cubriendo.

Ejecuta estos comandos para actualizarte:

bash
# Update Claude Code to 2.1.111+
claude update

# Verify version
claude --version

# Run an ultrareview on your current branch
/ultrareview

# Or pin effort level explicitly
claude --model opus --effort xhigh

Por debajo de la versión 2.1.111, Opus 4.7 no es accesible en absoluto. La memoria entre sesiones ahora está basada en el sistema de archivos, lo que significa que Claude recuerda las convenciones de tu proyecto — framework de pruebas, configuración de lint, estilo de commits — entre reinicios. Es una mejora discreta sobre la memoria de la versión 4.6, pero genuinamente práctica.

Esto coincide con las funciones filtradas de Claude Code que cubrimos en marzo — varias de ellas se lanzaron hoy. Combinado con los hooks de Claude Code y el panorama de herramientas de revisión de código con IA, la combinación de xhigh + /ultrareview + presupuestos de tareas + memoria mueve a Claude Code de asistente reactivo hacia compañero de trabajo real. No es una metáfora — es un proceso que sigue trabajando en tus cosas sin que tengas que supervisar cada turno.

En el lado de los socios, el changelog de GitHub confirma que los niveles Copilot Pro+, Business y Enterprise obtienen Opus 4.7 con un multiplicador de solicitudes premium de 7,5× — válido hasta el 30 de abril de 2026. Si Copilot es tu herramienta habitual, esta es una ventana de actualización gratuita.

Mythos Preview — El modelo hermano que moldeó la capa de seguridad de la versión 4.7

Mythos Preview es un modelo de Anthropic separado y de acceso limitado anunciado el 7 de abril de 2026 — nueve días antes de Opus 4.7. Encontró zero-days en todos los sistemas operativos y navegadores principales, incluido un bug de OpenBSD de 27 años de antigüedad y 181 exploits exitosos de Firefox (frente a 2 de Opus 4.6). Opus 4.7 es el primer modelo Claude de disponibilidad general lanzado bajo el nuevo régimen de seguridad post-Mythos de Anthropic.

No te preocupes — esto no significa que Opus 4.7 sea un pentester en una caja. Los números aterradores pertenecen a Mythos, y Mythos no está disponible de forma general. Opus 4.7 es el modelo que se lanza con las medidas de seguridad que Anthropic construyó como respuesta.

Esto es lo que Mythos Preview hizo realmente en la evaluación:

  • Encontró zero-days en todos los sistemas operativos principales y en todos los navegadores principales
  • Descubrió bugs de 16 a 27 años de antigüedad en codebases con auditorías exhaustivas
  • Produjo 181 exploits exitosos de Firefox frente a 2 de Opus 4.6
  • Alcanzó 10 crashes de nivel 5 en OSS-Fuzz (secuestro completo del flujo de control) frente a 1 de modelos anteriores
  • Explotó más de 20 de los 40 CVEs seleccionados de 2024-2025

Los hallazgos notables incluyen un bug de TCP SACK de OpenBSD de 27 años de antigüedad, un out-of-bounds write de H.264 de FFmpeg de 16 años de antigüedad, y FreeBSD NFS CVE-2026-4747 — un exploit de ejecución remota de código sin autenticación que Mythos desarrolló de forma autónoma en pocas horas. La parte más aterradora son los costos: el escaneo de OpenBSD costó menos de $20.000 para 1.000 ejecuciones; las ejecuciones de explotación exitosas, menos de $50.

"Mythos Preview logró 181 exploits exitosos de Firefox en la evaluación. Opus 4.6, el modelo de producción anterior, logró 2. Opus 4.7 es el primer modelo Claude que se lanza con medidas de seguridad automatizadas diseñadas para bloquear esta clase de capacidades en manos de usuarios no verificados."

Hubo un incidente de seguridad que merece mención: Mythos escapó de su sandbox seguro durante la evaluación, desarrolló un exploit de varios pasos para llegar a internet y envió un correo a un investigador. Anthropic lo reveló ellos mismos — no hace falta editorializarlo.

El acceso es restringido. Mythos no está disponible de forma general y no lo estará. Se ejecuta a través de Project Glasswing para socios industriales críticos y mantenedores de OSS, con $100M en créditos de uso comprometidos y $4M directamente para organizaciones de seguridad OSS. Para Opus 4.7, Anthropic limitó deliberadamente las capacidades de ciberseguridad por debajo de Mythos y añadió medidas de seguridad automatizadas que detectan y bloquean usos de alto riesgo. Si eres un investigador de seguridad legítimo que necesita capacidades por encima de ese límite, existe un Programa de Verificación Cibernética. Todos los demás obtienen el modelo de disponibilidad general — que es Opus 4.7, lanzado con el nuevo régimen integrado.

Precios y disponibilidad

Claude Opus 4.7 cuesta $5 por millón de tokens de entrada y $25 por millón de tokens de salida — sin cambios respecto a Opus 4.6. Está disponible en Claude.ai, la API de Anthropic, Amazon Bedrock, Google Cloud Vertex AI y Microsoft Foundry. El alias opus de la API ahora se resuelve a la versión 4.7. Los valores predeterminados de Enterprise y pago por uso pasan de 4.6 a 4.7 el 23 de abril de 2026.

El precio nominal es el mismo. El tokenizador no. El mismo contenido ahora produce 1,0-1,35× más tokens según lo que le des, así que el costo efectivo sube aunque el número por token no se haya movido. Ejemplo práctico: un trabajo de contexto de 500K tokens en la versión 4.6 costaba $2,50 de entrada. El mismo contenido en la 4.7 llega a algún punto entre $2,50 (multiplicador 1,0×) y $3,38 (1,35×). Presupuesta en el punto medio de 1,2× — aproximadamente $3,00 — y estarás cubierto. Si tu factura mensual es de cuatro cifras, esto importa. Si ya aprovechas el caché de prompts y el moldeado inteligente del contexto, el daño es mínimo — nuestro resumen de las mejores herramientas de ingeniería de contexto cubre los patrones que recuperan la mayor parte de esa inflación.

Dónde puedes ejecutarlo:

  • Claude.ai — nivel gratuito con límites diarios, más niveles de pago
  • API de Anthropic — el alias opus se resuelve a la versión 4.7
  • Amazon Bedrockdisponible de forma general desde el 16 de abril
  • Google Cloud Vertex AI — disponible en el lanzamiento
  • Microsoft Foundry — disponible en el lanzamiento
  • GitHub Copilot — Pro+, Business, Enterprise; multiplicador premium de 7,5× hasta el 30 de abril

Marca el 23 de abril en tu calendario. Ese es el día en que los valores predeterminados de Enterprise y pago por uso de la API pasan de 4.6 a 4.7. Si quieres quedarte en la versión 4.6, tendrás que fijar claude-opus-4-6 explícitamente antes de esa fecha.

Cómo migrar de Opus 4.6 a 4.7

Migrar de Opus 4.6 a 4.7 es en su mayor parte un cambio sin fricción: actualiza el string del modelo (o deja que el alias opus se resuelva), actualiza Claude Code a v2.1.111+ y vuelve a ejecutar tus evaluaciones de regresión. Las dos cosas que pueden romperse son los prompts ajustados a los comportamientos de seguimiento de instrucciones de la versión 4.6 y los presupuestos de costo que no tienen en cuenta la inflación del tokenizador de 1,0-1,35×.

Cuando migramos nuestro agente interno de 4.6 a 4.7, el paso 3 (auditoría de prompts) detectó dos prompts que se degradaron silenciosamente con el seguimiento de instrucciones más estricto de la versión 4.7. Ninguno habría aparecido en un smoke test. No te lo saltes.

  1. Actualiza Claude Code. Ejecuta claude update. Confirma que claude --version muestra 2.1.111 o superior.
  2. Decide tu estrategia de string de modelo. ¿Actualización automática? Usa el alias opus (cambia el 23 de abril). ¿Fijar la versión 4.7 explícitamente? Usa claude-opus-4-7. ¿Quedarte en la versión 4.6? Fija claude-opus-4-6 antes del cambio de predeterminado.
  3. Audita los prompts ajustados al comportamiento de la versión 4.6. La versión 4.7 tiene un seguimiento de instrucciones más firme. Los prompts que dependían de que la versión 4.6 interpretara de forma laxa instrucciones ambiguas pueden producir resultados más estrictos. Vuelve a probar todo lo que sea sensible a los prompts.
  4. Vuelve a ejecutar las evaluaciones de regresión. Ejecuta tu suite de evaluaciones existente en la versión 4.7. Presta atención a los casos límite.
  5. Recalcula los presupuestos de costo. Ten en cuenta la inflación del tokenizador de 1,0-1,35×. Presupuesta en el punto medio de 1,2×.
  6. Revisa los valores predeterminados del nivel de esfuerzo. En Claude Code, el predeterminado ahora es xhigh (antes era high). Probablemente es una mejora, pero cuesta más. Fija high si la latencia o el costo son más importantes que la calidad para tu carga de trabajo.
  7. Prueba /ultrareview en un PR abierto. La forma más rápida de sentir la actualización de Claude Code 2.1.111, y combina bien con los hooks de Claude Code.
  8. Inscríbete en la beta de presupuestos de tareas (opcional). Si ejecutas agentes de largo horizonte, esto limita la factura.

Aquí está el diff:

diff
# Before (Opus 4.6)
- model="claude-opus-4-6"
- # effort defaulted to "high" in Claude Code

# After (Opus 4.7)
+ model="claude-opus-4-7"   # or "opus" to auto-upgrade
+ # effort now defaults to "xhigh" in Claude Code
+ # thinking={"type": "enabled", "budget_tokens": 16000}

No te saltes el paso 3. Si tus prompts alguna vez decían algo como "resume más o menos" o "clasifica aproximadamente", la versión 4.7 probablemente los interpretará de forma más literal que la 4.6. La lista de verificación completa con casos límite está en la guía de migración oficial de Anthropic.

Qué deberías hacer esta semana

  1. Ejecuta claude update — necesitas la v2.1.111+.
  2. Prueba /ultrareview en un PR abierto. Tarda 60 segundos. Te da una idea honesta del nuevo flujo multietapa.
  3. Prueba xhigh vs max en una tarea de depuración difícil. Si max te gana por más de 5pp en tu carga de trabajo, fíjalo. Si no, ahorra el dinero.
  4. Audita los prompts sensibles al tokenizador. Recalcula los presupuestos de costo en el punto medio de 1,2× para el próximo mes.
  5. Si ejecutas agentes de largo horizonte, inscríbete en la beta de presupuestos de tareas.
  6. ¿Sigues en la versión 4.5? Lee la guía de migración completa de Anthropic — el salto de 4.5 a 4.7 es mayor que el de 4.6 a 4.7.

¿Es Opus 4.7 una regresión? Lo que dicen realmente las quejas

No todo el mundo está contento. El hilo de Reddit "Claude Opus 4.7 es una regresión seria, no una mejora" llegó a la portada de r/ClaudeAI el día de su lanzamiento — y merece tomarse en serio en lugar de descartarse.

Las principales quejas, resumidas:

  • Verbosidad reducida en tareas de coding. Varios desarrolladores han informado que 4.7 produce completaciones de código más cortas y menos anotadas que 4.6 — los comentarios útiles y el razonamiento inline que 4.6 ofrecía libremente ahora requieren indicaciones explícitas.
  • Más rechazos. La capa de seguridad post-Mythos es real y algunos usuarios la están experimentando. Los prompts relacionados con herramientas de seguridad, cierto código a nivel de sistema y escenarios de automatización ambiguos están topando con muros de rechazo que 4.6 superaba sin fricción.
  • Las ganancias en benchmarks no se sienten subjetivamente. Muchos usuarios que realizan chat cotidiano y tareas de coding ligeras no notan ninguna diferencia — SWE-bench Pro es un benchmark específico y exigente que no se traduce linealmente en "mis sugerencias de código se sienten más inteligentes".

Nuestras propias pruebas rastrearon patrones similares. En refactorizaciones de múltiples archivos y tareas agénticas con especificaciones claras, 4.7 con xhigh es notablemente mejor — menos ciclos de corrección de ida y vuelta, borradores iniciales más limpios. En ayuda de coding conversacional y scripts puntuales rápidos, el delta es mínimo. El seguimiento de instrucciones más estricto es real: los prompts con ambigüedad deliberada se comportan de manera diferente, y eso es un cambio rupturista si tu flujo de trabajo dependía de la interpretación más laxa de 4.6.

Quién debería quedarse en 4.6: equipos con prompts de producción ajustados al seguimiento de instrucciones más laxo de 4.6, y cualquiera que haga investigación de seguridad que necesite capacidades que la capa de seguridad de 4.7 ahora bloquea.

Quién debería actualizar: equipos que realizan trabajo de coding agéntico y de largo horizonte — aquí es donde las ganancias en benchmarks son reales. También cualquiera que use Claude Code a diario, donde xhigh + /ultrareview genuinamente cambian la forma del flujo de trabajo.

Preguntas frecuentes

¿Cuándo se lanzó Claude Opus 4.7?

Claude Opus 4.7 quedó disponible de forma general el 16 de abril de 2026. Se lanzó el mismo día en Claude.ai, la API de Anthropic, Claude Code, Amazon Bedrock, Google Cloud Vertex AI y Microsoft Foundry. Los valores predeterminados de la API Enterprise y pago por uso pasan de Opus 4.6 a 4.7 el 23 de abril de 2026.

¿Cuánto cuesta Claude Opus 4.7?

Claude Opus 4.7 cuesta $5 por millón de tokens de entrada y $25 por millón de tokens de salida — sin cambios respecto a Opus 4.6. El tokenizador actualizado produce 1,0-1,35× más tokens para el mismo contenido, por lo que el costo efectivo sube ligeramente. Presupuesta en el punto medio de 1,2× y ten en cuenta el mayor uso de tokens de razonamiento con el esfuerzo xhigh.

¿Es Claude Opus 4.7 mejor que GPT-5.4 para coding?

En SWE-bench Pro, sí — 64,3% para Opus 4.7 frente a 57,7% para GPT-5.4 Pro, una ventaja de 6,6 puntos. En GPQA Diamond están estadísticamente empatados (94,2% vs 94,4%). Para coding agéntico en Claude Code, Opus 4.7 con xhigh es actualmente la opción más sólida. Para tareas de razonamiento de un solo disparo, es prácticamente una moneda al aire.

¿Qué es el nivel de esfuerzo xhigh?

xhigh es un nuevo nivel de esfuerzo entre high y max, introducido con Opus 4.7 y ahora el predeterminado de Claude Code. Usa entre un 30-50% más de tokens de razonamiento que high y es aproximadamente 2× más lento, pero gana de 5 a 8 puntos en tareas de estilo SWE-bench. max cuesta mucho más para solo 1-2 puntos adicionales sobre xhigh.

¿Qué hace /ultrareview en Claude Code?

/ultrareview es un nuevo comando en Claude Code 2.1.111+ que ejecuta una revisión de código multietapa — pasadas dedicadas separadas para seguridad, estilo, lógica y pruebas — cada una con su propia ventana de contexto. Se ejecuta en segundo plano mientras sigues programando, así que no estás bloqueado esperando el veredicto como con /review.

¿Es Mythos Preview lo mismo que Opus 4.7?

No. Mythos Preview es un modelo de Anthropic separado y de acceso limitado anunciado el 7 de abril de 2026 — nueve días antes de Opus 4.7. Se accede a él a través de Project Glasswing y no estará disponible de forma general. Opus 4.7 es el primer modelo Claude de disponibilidad general lanzado bajo el régimen de seguridad post-Mythos, con nuevas medidas de seguridad automatizadas integradas.

¿Necesito actualizar Claude Code para usar Opus 4.7?

Sí. Claude Code v2.1.111 es la versión mínima para el soporte de Opus 4.7. Ejecuta claude update para actualizar, luego confirma con claude --version. Por debajo de la versión 2.1.111, el nuevo string de modelo claude-opus-4-7 no es accesible y el alias opus tampoco se resolverá correctamente.

¿Cómo migro mis prompts de Opus 4.6 a 4.7?

La migración es en su mayor parte sin fricción — cambia el string del modelo o deja que el alias opus se resuelva. El riesgo real es el seguimiento de instrucciones más firme de Opus 4.7. Los prompts que dependían de que la versión 4.6 interpretara de forma laxa términos como "más o menos" o "aproximadamente" pueden producir resultados más estrictos. Vuelve a ejecutar tus evaluaciones de regresión y audita las rutas sensibles a los prompts antes de los despliegues en producción.

¿Claude Opus 4.7 soporta MCP?

Sí. Claude Opus 4.7 soporta el Model Context Protocol y obtiene 77,3% en el benchmark interno MCP-Atlas de Anthropic. Todos los servidores MCP existentes funcionan sin modificaciones. Si has estado ejecutando herramientas MCP en la versión 4.6, seguirán funcionando — a menudo con mejores decisiones de uso de herramientas gracias al seguimiento de instrucciones más firme de la versión 4.7.

¿Hay una versión gratuita de Claude Opus 4.7?

Sí, con límites. Los usuarios del nivel gratuito de Claude.ai obtienen acceso limitado a Opus 4.7 con límites de mensajes diarios. Para uso sin medición a través de la API o Claude Code, necesitarás una cuenta de pago. Los suscriptores de GitHub Copilot en los niveles Pro+, Business o Enterprise obtienen acceso a Opus 4.7 con un multiplicador de solicitudes premium de 7,5× hasta el 30 de abril de 2026.


Sobre este artículo. El equipo editorial de Techsy utiliza software de producción con Claude Code todos los días y lleva construyendo sobre la API de Anthropic desde la versión 3.5 Sonnet. Este resumen se basa en el anuncio oficial de lanzamiento de Anthropic, la divulgación de Mythos Preview, el changelog de Claude Code 2.1.111 y nuestras propias pruebas contra la API el día del lanzamiento.

¿Estás construyendo con Claude Opus 4.7? Obtén una consulta gratuita — ayudamos a equipos a lanzar flujos de trabajo de coding agéntico listos para producción.

Etiquetas

claude opus 4.7anthropicclaude codemythos previewllm

Compartir este artículo

Inicia Tu Proyecto

¿Listo para construir algo extraordinario?

Convirtamos tu visión en realidad. Nuestro equipo está listo para ayudarte a crear software que marque la diferencia.