
Grok 4.6 vs Grok 4.5: hicimos 80 llamadas a la API el día de lanzamiento, mismos 40/40, 1.38× la factura
Grok 4.6 nos costó $0.2992 para terminar 40 tareas evaluadas. Grok 4.5 costó $0.2174 para las mismas 40, y devolvió las mismas respuestas.
Lo medimos el 12 de agosto de 2026, horas después de que SpaceXAI (antes xAI) lanzara el modelo. Misma tarifa: $2 por millón de tokens de entrada, $6 de salida. Misma puntuación: 40/40 contra 40/40. La diferencia es 1.90× la mediana de tokens de salida en 4.6, lo que se traduce en una factura un 38% mayor.
Qué lanzó SpaceXAI el 12 de agosto
SpaceXAI lanzó Grok 4.6 el 12 de agosto de 2026 a $2 por millón de tokens de entrada y $6 de salida, la misma tarifa que Grok 4.5. Salió a las 08:56 PT según 9to5Mac, y el anuncio oficial (consultado el 2026-08-12) destaca la codificación agéntica sin publicar ninguna cifra de coste de operación, latencia o consumo de tokens.
- Disponibilidad el mismo día como
grok-4.6en la API de SpaceXAI yx-ai/grok-4.6en OpenRouter. - Una ventana de contexto de 500K tokens, sin cambios respecto a Grok 4.5.
- $2/M de entrada, $6/M de salida, más una variante rápida al doble de tarifa.
- Una puntuación de 61 en el Artificial Analysis Intelligence Index, presentada por el proveedor como equivalente a GPT-5.6 Sol.
- Una comparación cualitativa con 4.5: primeras pasadas más sólidas en proyectos visuales e interactivos.
El artículo de lanzamiento de Cursor se lee como una validación independiente y no lo es: SpaceX acordó comprar a la creadora de Cursor, Anysphere, por $60B en acciones el 16 de junio de 2026.
¿Deberías cambiarte a Grok 4.6?
Quédate en 4.5 para trabajo estructurado rutinario: nuestras 80 llamadas devolvieron respuestas idénticas por 1.38× el dinero. La tarjeta de precios es idéntica byte a byte en las dos páginas de modelo de OpenRouter, así que ninguna página de precios puede avisarte. Los recuentos de tokens sí pueden.
| Métrica | Grok 4.6 | Grok 4.5 |
|---|---|---|
| AA Intelligence Index | 61 | 56 |
| Precio por M (entrada / salida) | $2 / $6 | $2 / $6 |
| Entrada en caché por M | $0.50 | $0.30 |
| Tareas superadas (nuestras, 80 llamadas) | 40/40 | 40/40 |
| Mediana de tokens de salida (nuestros) | 409 | 215 |
| Coste por la misma respuesta (medido) | $0.2992 | $0.2174 |
| Latencia mediana (nuestra) | 5.25 s | 4.17 s |
| Elige este si | trabajo agéntico de largo alcance | llamadas estructuradas cortas a volumen |
Las filas marcadas "nuestras" son nuestras, medidas el día de lanzamiento; las filas de índice y caché son de Artificial Analysis, consultadas el 2026-08-12.
Misma tarjeta de precios, 1.90× los tokens, por lo tanto aproximadamente 1.38× la factura por las mismas respuestas. Esa es la cuestión de grok 4.6 vs grok 4.5 para la mayoría del tráfico en producción: mismo precio por token, una factura distinta.
Qué mostraron realmente 80 llamadas a la API el día de lanzamiento
En 80 llamadas del día de lanzamiento a temperatura cero, ambos modelos puntuaron 40/40 mientras 4.6 gastó 1.90× la mediana de tokens de salida.
Enviamos cada prompt dos veces, una a x-ai/grok-4.6 y otra a x-ai/grok-4.5, medido a través de OpenRouter a temperature: 0. La ronda 1 (24 llamadas) fue fácil: las tareas de esquema JSON que evaluamos, un cálculo de precios, una corrección de bug en Python, una tarea de escritura restringida. La ronda 2 (24 llamadas) se puso más difícil después de que la ronda 1 se saturara: un rompecabezas de programación de horarios, una trampa de conversión de unidades, una recuperación de aguja en un texto de 402 líneas con un señuelo REVOKED, y una tarea de especificación donde retry_on debe contener 429 y 503 pero no 500. La ronda 3 (32 llamadas) es el control de abajo. Todos los evaluadores son deterministas; nada se juzga con LLM. Scripts grok_bench.py, grok_bench_hard.py, grok_bench_effort.py; datos en bruto en benchmark-raw.json, benchmark-hard-raw.json, benchmark-effort-raw.json. Gasto total, $0.52.
for model in ("x-ai/grok-4.6", "x-ai/grok-4.5"):
r = httpx.post("https://openrouter.ai/api/v1/chat/completions",
headers={"Authorization": f"Bearer {KEY}"},
json={"model": model, "temperature": 0,
"messages": [{"role": "user", "content": PROMPT}]}).json()
u = r["usage"]
print(model, u["completion_tokens"],
u["completion_tokens_details"]["reasoning_tokens"])| Ronda de esfuerzo por defecto | Grok 4.6 | Grok 4.5 |
|---|---|---|
| 1, fácil (24 llamadas) | 12/12, 468 tok de salida (mediana) | 12/12, 241 tok |
| 2, difícil (24 llamadas) | 12/12, 493 tok de salida (mediana) | 12/12, 332 tok |
El consenso previo al lanzamiento, un post en X de @haider1 fechado el 11 de agosto y copiado en blogs agregadores, decía que 4.6 mantendría la velocidad y la eficiencia de tokens de 4.5. SpaceXAI nunca afirmó eso; su anuncio no hace ninguna afirmación sobre tokens. Unite.AI señaló el día de lanzamiento que "ninguna evaluación independiente ha confirmado todavía" las afirmaciones del modelo, así que aquí tienes una. Grok 4.6 usó 409 tokens de salida (mediana) frente a los 215 de Grok 4.5 en prompts idénticos a temperatura cero, 365 tokens de razonamiento (mediana) frente a 200, y 27,565 tokens totales frente a 13,929. Sea lo que sea que gane 4.6, lo paga con 1.90× la mediana de tokens de salida.
La cola es donde duele
Mismo prompt, temperature: 0, tres intentos de unit_trap en las rondas de esfuerzo por defecto:
| Intento | Grok 4.6 | Grok 4.5 |
|---|---|---|
| 1 | 12.25 s / 726 tok | 8.38 s / 414 tok |
| 2 | 23.20 s / 1,400 tok | 15.32 s / 750 tok |
| 3 | 81.61 s / 4,770 tok | 10.08 s / 480 tok |
Una dispersión de 6.6× en 4.6 frente a 1.8× en 4.5, sobre entradas idénticas byte a byte. Al dimensionar un timeout o un presupuesto de tokens por solicitud, esa cola importa más que la mediana, y es un argumento a favor de saber cuándo el modelo más nuevo es la opción por defecto equivocada.
La tarea que fue en la otra dirección
En constraint_schedule, 4.6 fue más rápido en la mediana en las rondas de esfuerzo por defecto: 26.38 s frente a 34.21 s, con menos tokens de salida además (1,644 frente a 1,710). Reportar solo los números que encajan con una tesis es justo lo que los lectores y Google penalizan.
¿Es el modelo, o es el ajuste por defecto?
Fijar reasoning_effort al mismo valor en ambos modelos no cierra la brecha; la amplía, de 1.51× a 2.91×. docs.x.ai (consultado el 2026-08-12) enumera cuatro niveles (low, medium, high, xhigh) y las rondas 1 y 2 nunca fijaron ninguno, así que la brecha podría haber sido un ajuste por defecto de fábrica. La ronda 3 lo fijó explícitamente en las 32 llamadas.
| Esfuerzo equiparado | Salida mediana de 4.6 | Salida mediana de 4.5 | Ratio | Precisión |
|---|---|---|---|---|
| low | 222 tok | 147 tok | 1.51× | 8/8 vs 8/8 |
| high | 606 tok | 208 tok | 2.91× | 8/8 vs 8/8 |
Si la brecha se hubiera cerrado con el esfuerzo equiparado, el titular honesto habría sido "it's just a default". No fue así.
¿Cómo reduces la factura de tokens de Grok 4.6?
Fija reasoning_effort en low y la mediana de salida de 4.6 baja de 438 a 222 tokens, con la precisión sin cambios en 8/8. Las mismas cuatro tareas de las dos formas: la cifra por defecto agrupa doce llamadas de las dos primeras rondas, la cifra de low agrupa ocho del control.
{
"model": "x-ai/grok-4.6",
"messages": [{"role": "user", "content": "..."}],
"temperature": 0,
"reasoning": {"effort": "low"}
}Eso es una reducción del 49%, que vale aproximadamente $1.30 por cada mil llamadas de este tipo a $6 por millón de tokens de salida. Un solo parámetro de la solicitud reduce a la mitad, aproximadamente, la factura de salida de Grok 4.6 en trabajo estructurado rutinario, y no renunció a nada que pudiéramos medir. Cuatro tareas son una señal, no una norma: pruébalo primero con tu propia combinación de tráfico.
Lo que muestran los contadores de otros
Artificial Analysis, en su propia suite de evaluación, facturó $1,068.47 para puntuar Grok 4.6 frente a $579.21 para Grok 4.5. Sus cifras, no las nuestras, de sus páginas de modelo de Grok 4.6 y Grok 4.5 en artificialanalysis.ai, consultadas el 2026-08-12.
| Métrica (Artificial Analysis) | Grok 4.6 (high) | Grok 4.5 (high) | Ratio |
|---|---|---|---|
| Intelligence Index | 61 | 56 | +5 pts |
| Tokens de salida para correr el índice | 72M | 60M | 1.20× |
| Coste de correr el índice | $1,068.47 | $579.21 | 1.84× |
| Tiempo hasta el primer token | 32.30 s | 8.68 s | 3.72× |
| Precio de acierto de caché por M | $0.50 | $0.30 | 1.67× |
Su 1.84× y nuestro 1.38× no coinciden, y la razón es reveladora: su mezcla de tareas es más pesada, y su total incluye tokens de entrada donde el nuestro aísla solo la salida. Dos instrumentos de medición distintos, la misma dirección.
La fila de caché fue señalada primero por el usuario de HN pzo en el hilo de lanzamiento (comentario 49275740) y se confirma en ambas páginas: sube un 67%, y es lo que más cuesta en las cargas de trabajo de agentes de larga duración a las que apunta 4.6, donde la reutilización de caché es todo el punto.
¿Es Grok 4.6 mejor que Claude para programar?
En corrección empata: Grok 4.6, Claude Sonnet 5 y Claude Opus 4.8 pasaron cada uno 10 de 10 pruebas de codificación ejecutadas. Ese es el titular, y para Grok, una ganancia real.
Dejamos de calificar texto para este caso. Cinco tareas con pruebas unitarias ocultas, dos intentos cada una, 30 llamadas: coincidencia de semver incluyendo el caso ^0.x, una caché LRU con TTL de reloj explícito, fusión de intervalos con límites que se tocan, un analizador de duración que debe rechazar 1m30h y 1.5h, y truncamiento seguro para grafemas que no debe dejar huérfana una marca combinante ni partir un emoji. Cada respuesta se ejecuta en un subproceso, y solo pasa si se cumple cada aserción. Script grok_vs_claude_coding.py, datos en bruto en benchmark-coding-raw.json.
p = subprocess.run([sys.executable, path], capture_output=True, timeout=20)
ok = p.returncode == 0 and "ALLPASS" in p.stdout # the model never sees the tests| Modelo | Superadas | Latencia mediana | Tok de salida mediana | $/M salida | Coste total |
|---|---|---|---|---|---|
| Grok 4.6 | 10/10 | 26.82 s | 2,016 | $6 | $0.1169 |
| Claude Sonnet 5 | 10/10 | 6.76 s | 500 | $10 | $0.0596 |
| Claude Opus 4.8 | 10/10 | 4.96 s | 411 | $25 | $0.1006 |
El empate en corrección es la noticia. La factura es la trampa: Grok 4.6 corrió 4.0× más lento que Sonnet 5 y 5.4× más lento que Opus 4.8, con 4.0× y 4.9× la mediana de tokens de salida. Ese apetito de tokens se come entera la ventaja de precio. Grok 4.6 costó más que Claude Opus 4.8 en estas cinco tareas pese a que sus tokens de salida son 4.2× más baratos, porque emitió 18,345 tokens de salida frente a los 3,630 de Opus 4.8. Frente a Sonnet 5 costó 1.96× más, y la tarifa de salida por token de Sonnet es la más alta de las dos. Una tarifa más barata no es un modelo más barato, la misma lección que enseñan las cifras de 4.6 frente a 4.5 una sección más arriba.
Un juicio, señalado como juicio y no como medición: en pipelines de medios y automatización de contenido hemos recurrido históricamente a Grok antes que a Claude, sobre todo por su ingesta nativa de X y su manejo más laxo de textos de marketing. No tenemos ningún benchmark para eso y no estamos presentando ninguno. En el trabajo de codificación que podemos calificar de forma determinista, los tres empatan en corrección y Grok paga de cuatro a cinco veces los tokens.
Lo que no probamos
Nuestras tareas se saturaron en 40/40, así que esto mide el coste en trabajo rutinario, no la capacidad en los trabajos agénticos para los que SpaceXAI afinó el modelo. Cinco límites:
- El empate en precisión es un efecto techo, no una prueba de que 4.6 no sea más inteligente. Nuestras tareas se quedaron sin dificultad antes que los modelos, y no ponen a prueba la codificación de frontera a largo alcance.
- Dos o tres intentos por tarea. Suficiente para señalar una dirección y una historia de varianza, no para un intervalo de confianza.
- Medido a través de OpenRouter, no del endpoint propio de SpaceXAI. El enrutamiento añade latencia que no es del modelo, razón por la cual los recuentos de tokens, independientes del proveedor, son los que sostienen el argumento.
- Una tarea fue en contra de la tesis,
constraint_schedule, donde 4.6 fue más rápido en la mediana. - La comparación con Claude también se saturó. Cinco tareas de codificación, los tres modelos con 10/10, así que separa coste y latencia pero no dice nada sobre qué modelo es más fuerte en el techo.
Tampoco probamos lo que SpaceXAI realmente afirma: primeras pasadas más sólidas en proyectos visuales e interactivos. No existe un evaluador determinista para eso, así que no lo estamos discutiendo. No tenemos ninguna relación comercial con SpaceXAI y pagamos cada llamada de nuestro bolsillo.
¿Quién debería actualizar, y quién debería quedarse en 4.5?
Actualiza si tu tráfico es trabajo agéntico de largo alcance; quédate en 4.5 si son llamadas estructuradas cortas a volumen. En el eje del índice que usa cualquier otro artículo de lanzamiento, 4.6 gana con una tarjeta de precios idéntica. En coste medido por respuesta correcta, grok 4.6 vs grok 4.5 se invierte.
| Tu carga de trabajo | Elige | Qué lo cambia |
|---|---|---|
| Llamadas estructuradas o JSON de alto volumen | Grok 4.5 | una tarea en la que 4.5 realmente falla |
| Codificación agéntica de largo alcance | Grok 4.6 | nada de lo que medimos; este es su caso |
| Rutas de usuario sensibles a la latencia | Grok 4.5 | la llamada de cola de 81.61 s, hasta que limites el esfuerzo |
| Sesiones con mucha reutilización de caché | haz cuentas | $0.50 frente a $0.30 por M puede eclipsar la diferencia de tokens |
| Ya está en 4.6 | quédate, pero fija el esfuerzo | dejarlo sin fijar cuesta un 49% más de salida |
Grok 4.5 sigue siendo la forma más barata de obtener la respuesta idéntica en trabajo estructurado rutinario. Eso no es lo mismo que decir que 4.6 sea peor: compra sus ganancias pensando más tiempo, y en las llamadas de producción del día a día ese intercambio es un aumento de coste sin ningún retorno de precisión que pudiéramos detectar. Un argumento más a favor de fijar una versión de modelo en un stack de agentes en vez de seguir latest.
Tres scripts, una clave de OpenRouter y menos de un dólar de crédito es todo el coste de comprobar si tu tráfico se parece al nuestro.
Preguntas frecuentes
¿Existe un Grok 5 o un Grok 5.6?
Ninguno de los dos existe. A fecha de 12 de agosto de 2026, Grok 4.6 es el modelo lanzado más reciente. Se señaló Grok 4.7 para finales de agosto o principios de septiembre y no se había lanzado cuando escribimos esto; cualquier cosa posterior está prevista para finales de 2026. El "5.6" es casi con toda seguridad GPT-5.6 Sol, un modelo de OpenAI contra el que se compara a Grok 4.6.
¿Grok 4.6 cuesta más que Grok 4.5?
Misma tarjeta de precios, $2/M de entrada y $6/M de salida en ambos. Nuestras 80 llamadas medidas devolvieron respuestas idénticas por 1.38× el coste total, porque 4.6 emite 1.90× la mediana de tokens de salida. La entrada en caché también subió de $0.30 a $0.50 por millón.
¿Grok 4.6 es más lento que Grok 4.5?
En nuestra mediana, 1.26× más lento: 5.25 s frente a 4.17 s en 40 llamadas de cada uno. En nuestra peor llamada, 2.27×: 81.61 s frente a 35.98 s. Artificial Analysis, midiendo por su cuenta, reporta un tiempo hasta el primer token de 32.30 s frente a 8.68 s. Ten en cuenta que medimos a través de OpenRouter, así que el enrutamiento añade latencia de la que el modelo en sí no es responsable.
¿Cuál es la ventana de contexto de Grok 4.6 y cómo lo llamo?
500K tokens, sin cambios respecto a Grok 4.5. El identificador es x-ai/grok-4.6 en OpenRouter y grok-4.6 en la API de SpaceXAI, con una variante rápida al doble de la tarifa estándar. Fija reasoning_effort explícitamente en vez de heredarlo; el valor por defecto es high, y en nuestras cuatro tareas de control bajarlo a low redujo a la mitad los tokens de salida sin costar ni una sola respuesta correcta.
¿Debería quedarme en Grok 4.5?
Para trabajo estructurado de alto volumen, sí: devolvió las mismas respuestas por menos dinero en las 80 llamadas. Para codificación agéntica de largo alcance, la carga de trabajo para la que SpaceXAI afinó 4.6, nuestras tareas no lo resuelven y no lo probamos. Mide tu propia combinación de tráfico.