
Grok 4.6 vs Grok 4.5 : 80 appels API le jour du lancement – même 40/40, facture 1.38× plus chère
Grok 4.6 nous a coûté $0.2992 pour terminer 40 tâches notées. Grok 4.5 a coûté $0.2174 pour les mêmes 40, et a renvoyé les mêmes réponses.
Nous avons mesuré cela le 12 août 2026, quelques heures après que SpaceXAI (anciennement xAI) a lancé le modèle. Même grille tarifaire : $2 par million de tokens en entrée, $6 en sortie. Même score : 40/40 contre 40/40. L'écart est de 1.90× la médiane de tokens en sortie sur 4.6, ce qui se traduit par une facture 38% plus élevée.
Ce que SpaceXAI a lancé le 12 août
SpaceXAI a lancé Grok 4.6 le 12 août 2026 à $2 par million de tokens en entrée et $6 en sortie, la même grille tarifaire que Grok 4.5. Le modèle est sorti à 08:56 PT selon 9to5Mac, et l'annonce officielle (consultée le 12/08/2026) met en avant le codage agentique sans publier le moindre chiffre de coût d'exploitation, de latence ou de consommation de tokens.
- Disponibilité le jour même sous
grok-4.6sur l'API SpaceXAI etx-ai/grok-4.6sur OpenRouter. - Une fenêtre de contexte de 500K tokens, inchangée par rapport à Grok 4.5.
- $2/M en entrée, $6/M en sortie, plus une variante rapide au double du tarif.
- Un score de 61 à l'Artificial Analysis Intelligence Index, présenté par l'éditeur comme équivalent à GPT-5.6 Sol.
- Une seule comparaison qualitative avec 4.5 : de meilleurs premiers essais sur les projets visuels et interactifs.
L'article de lancement de Cursor ressemble à une validation indépendante mais n'en est pas une : SpaceX a accepté de racheter Anysphere, l'éditeur de Cursor, pour $60B en actions le 16 juin 2026.
Faut-il passer à Grok 4.6 ?
Reste sur 4.5 pour le travail structuré courant : nos 80 appels ont renvoyé des réponses identiques pour 1.38× le prix. La grille tarifaire est identique au byte près sur les deux pages de modèle OpenRouter, donc aucune page de tarifs ne peut t'alerter. Les compteurs de tokens, si.
| Métrique | Grok 4.6 | Grok 4.5 |
|---|---|---|
| AA Intelligence Index | 61 | 56 |
| Prix par million (entrée / sortie) | $2 / $6 | $2 / $6 |
| Entrée en cache par million | $0.50 | $0.30 |
| Tâches réussies (nos 80 appels) | 40/40 | 40/40 |
| Médiane de tokens en sortie (nos mesures) | 409 | 215 |
| Coût pour la même réponse (mesuré) | $0.2992 | $0.2174 |
| Latence médiane (nos mesures) | 5.25 s | 4.17 s |
| À choisir si | travail agentique long | appels structurés courts en volume |
Les lignes marquées « nos mesures » sont les nôtres, mesurées le jour du lancement ; les lignes index et cache viennent d'Artificial Analysis, consultées le 12/08/2026.
Grille tarifaire identique, 1.90× de tokens, donc environ 1.38× la facture pour les mêmes réponses. C'est toute la question grok 4.6 vs grok 4.5 pour la plupart du trafic en production : même prix par token, une facture différente.
Ce que 80 appels API le jour du lancement ont vraiment montré
Sur 80 appels du jour de lancement à température zéro, les deux modèles ont obtenu 40/40 tandis que 4.6 consommait 1.90× la médiane de tokens en sortie.
Nous avons envoyé chaque prompt deux fois, une fois à x-ai/grok-4.6 et une fois à x-ai/grok-4.5, mesurés via OpenRouter à temperature: 0. Le round 1 (24 appels) était facile : les tâches de schéma JSON que nous avons notées, un calcul de tarification, une correction de bug Python, une tâche d'écriture contrainte. Le round 2 (24 appels) est devenu plus difficile après la saturation du round 1 : un casse-tête de planification, un piège de conversion d'unités, une recherche d'aiguille de 402 lignes avec un leurre REVOKED, et une tâche de spécification où retry_on doit contenir 429 et 503 mais pas 500. Le round 3 (32 appels) est le contrôle ci-dessous. Chaque correcteur est déterministe ; rien n'est jugé par un LLM. Scripts grok_bench.py, grok_bench_hard.py, grok_bench_effort.py ; sorties brutes dans benchmark-raw.json, benchmark-hard-raw.json, benchmark-effort-raw.json. Dépense totale, $0.52.
for model in ("x-ai/grok-4.6", "x-ai/grok-4.5"):
r = httpx.post("https://openrouter.ai/api/v1/chat/completions",
headers={"Authorization": f"Bearer {KEY}"},
json={"model": model, "temperature": 0,
"messages": [{"role": "user", "content": PROMPT}]}).json()
u = r["usage"]
print(model, u["completion_tokens"],
u["completion_tokens_details"]["reasoning_tokens"])| Round à effort par défaut | Grok 4.6 | Grok 4.5 |
|---|---|---|
| 1, facile (24 appels) | 12/12, 468 tok médians en sortie | 12/12, 241 tok |
| 2, difficile (24 appels) | 12/12, 493 tok médians en sortie | 12/12, 332 tok |
Le consensus pré-lancement, un post X de @haider1 daté du 11 août et repris par des blogs agrégateurs, affirmait que 4.6 conserverait la vitesse et l'efficacité en tokens de 4.5. SpaceXAI n'a jamais affirmé cela ; son annonce ne fait aucune allégation sur les tokens. Unite.AI notait le jour du lancement qu'« aucune évaluation indépendante n'a encore confirmé » les affirmations du modèle, alors en voici une. Grok 4.6 a utilisé une médiane de 409 tokens en sortie contre 215 pour Grok 4.5 sur des prompts identiques à température zéro, 365 tokens de raisonnement médians contre 200, et 27,565 au total contre 13,929. Quoi que 4.6 gagne, il le paie avec 1.90× la médiane de tokens en sortie.
La queue de distribution, c'est là que ça fait mal
Même prompt, temperature: 0, trois essais de unit_trap dans les rounds à effort par défaut :
| Essai | Grok 4.6 | Grok 4.5 |
|---|---|---|
| 1 | 12.25 s / 726 tok | 8.38 s / 414 tok |
| 2 | 23.20 s / 1,400 tok | 15.32 s / 750 tok |
| 3 | 81.61 s / 4,770 tok | 10.08 s / 480 tok |
Un écart de 6.6× sur 4.6 contre 1.8× sur 4.5, sur des entrées identiques au byte près. Pour dimensionner un timeout ou un budget de tokens par requête, cette queue de distribution compte plus que la médiane, et cela plaide pour savoir quand le modèle le plus récent est le mauvais choix par défaut.
La seule tâche qui est allée dans l'autre sens
Sur constraint_schedule, 4.6 était plus rapide à la médiane dans les rounds à effort par défaut : 26.38 s contre 34.21 s, avec aussi moins de tokens en sortie (1,644 contre 1,710). Ne rapporter que les chiffres qui confirment une thèse, c'est exactement ce que les lecteurs et Google sanctionnent.
Est-ce le modèle, ou est-ce le réglage par défaut ?
Fixer reasoning_effort à la même valeur sur les deux modèles ne réduit pas l'écart, il l'accroît, passant de 1.51× à 2.91×. docs.x.ai (consulté le 12/08/2026) liste quatre niveaux (low, medium, high, xhigh) et les rounds 1 et 2 n'en fixaient aucun, donc l'écart aurait pu venir d'un réglage par défaut du lancement. Le round 3 l'a fixé explicitement sur 32 appels.
| Effort identique | 4.6 médiane en sortie | 4.5 médiane en sortie | Ratio | Précision |
|---|---|---|---|---|
| low | 222 tok | 147 tok | 1.51× | 8/8 vs 8/8 |
| high | 606 tok | 208 tok | 2.91× | 8/8 vs 8/8 |
Si l'écart s'était effondré à effort identique, le titre honnête aurait été « c'est juste un réglage par défaut ». Ce n'est pas le cas.
Comment réduire la facture de tokens de Grok 4.6 ?
Fixer reasoning_effort à low fait chuter la médiane de tokens en sortie de 4.6 de 438 à 222, sans changement de précision, toujours 8/8. Mêmes quatre tâches dans les deux cas : le chiffre par défaut regroupe douze appels des deux premiers rounds, le chiffre low en regroupe huit issus du contrôle.
{
"model": "x-ai/grok-4.6",
"messages": [{"role": "user", "content": "..."}],
"temperature": 0,
"reasoning": {"effort": "low"}
}C'est une réduction de 49%, soit environ $1.30 pour mille appels de ce type au tarif de $6 par million de tokens en sortie. Un seul paramètre de requête réduit de près de moitié la facture de sortie de Grok 4.6, sans rien sacrifier que nous ayons pu mesurer. Quatre tâches, c'est un signal, pas une règle : teste-le sur ton propre trafic d'abord.
Ce que montrent les compteurs des autres
Artificial Analysis, sur sa propre suite d'évaluation, a facturé $1,068.47 pour noter Grok 4.6 contre $579.21 pour Grok 4.5. Leurs chiffres, pas les nôtres, tirés de leurs pages modèle Grok 4.6 et Grok 4.5 sur artificialanalysis.ai, consultées le 12/08/2026.
| Métrique (Artificial Analysis) | Grok 4.6 (high) | Grok 4.5 (high) | Ratio |
|---|---|---|---|
| Intelligence Index | 61 | 56 | +5 pts |
| Tokens en sortie pour faire tourner l'index | 72M | 60M | 1.20× |
| Coût pour faire tourner l'index | $1,068.47 | $579.21 | 1.84× |
| Temps jusqu'au premier token | 32.30 s | 8.68 s | 3.72× |
| Prix cache par million | $0.50 | $0.30 | 1.67× |
Leur 1.84× et notre 1.38× ne concordent pas, et la raison est instructive : leur panel de tâches est plus lourd, et leur total intègre les tokens en entrée là où le nôtre isole la sortie. Deux instruments de mesure indépendants, une même direction.
La ligne cache a d'abord été repérée par l'utilisateur HN pzo dans le fil de lancement (commentaire 49275740) et se confirme sur les deux pages : en hausse de 67%, et c'est ce qui coûte le plus cher sur les charges de travail agentiques longue durée que vise 4.6, là où la réutilisation du cache est tout l'intérêt.
Grok 4.6 est-il meilleur que Claude pour coder ?
Sur la justesse, il fait jeu égal : Grok 4.6, Claude Sonnet 5 et Claude Opus 4.8 ont chacun réussi 10 tâches de codage exécutées sur 10. C'est le titre, et pour Grok un vrai progrès.
Nous avons arrêté de noter le texte pour celui-ci. Cinq tâches avec des tests unitaires cachés, deux essais chacune, 30 appels : correspondance semver incluant le cas ^0.x, un cache LRU avec TTL à horloge explicite, une fusion d'intervalles avec bornes qui se touchent, un analyseur de durée qui doit rejeter 1m30h et 1.5h, et une troncature respectueuse des graphèmes qui ne doit ni isoler un signe combinant ni couper un emoji. Chaque réponse s'exécute dans un sous-processus, et ne réussit que si chaque assertion tient. Script grok_vs_claude_coding.py, données brutes dans benchmark-coding-raw.json.
p = subprocess.run([sys.executable, path], capture_output=True, timeout=20)
ok = p.returncode == 0 and "ALLPASS" in p.stdout # the model never sees the tests| Modèle | Réussies | Latence médiane | Tokens médians en sortie | $/M en sortie | Coût total |
|---|---|---|---|---|---|
| Grok 4.6 | 10/10 | 26.82 s | 2,016 | $6 | $0.1169 |
| Claude Sonnet 5 | 10/10 | 6.76 s | 500 | $10 | $0.0596 |
| Claude Opus 4.8 | 10/10 | 4.96 s | 411 | $25 | $0.1006 |
La justesse à égalité, c'est la nouvelle. La facture, c'est le piège : Grok 4.6 a tourné 4.0× plus lentement que Sonnet 5 et 5.4× plus lentement qu'Opus 4.8, pour 4.0× et 4.9× la médiane de tokens en sortie. Cet appétit en tokens engloutit tout l'avantage de prix. Grok 4.6 a coûté plus cher que Claude Opus 4.8 sur ces cinq tâches malgré des tokens de sortie 4.2× moins chers, parce qu'il a émis 18,345 tokens en sortie contre 3,630 pour Opus 4.8. Face à Sonnet 5, il a coûté 1.96× plus cher, alors que le tarif de sortie par token de Sonnet est le plus élevé des deux. Un tarif moins cher n'est pas un modèle moins cher, la même leçon qu'enseignent les chiffres de 4.6 face à 4.5 une section plus haut.
Un jugement, signalé comme tel plutôt que comme une mesure : sur les pipelines médias et d'automatisation de contenu, nous avons historiquement préféré Grok à Claude, surtout pour son ingestion native de X et sa gestion plus souple du texte marketing. Nous n'avons aucun benchmark pour cela et n'en présentons aucun. Sur le travail de codage que nous pouvons noter de façon déterministe, les trois font jeu égal sur la justesse et Grok paie quatre à cinq fois plus de tokens.
Ce que nous n'avons pas testé
Nos tâches ont saturé à 40/40, donc ceci mesure le coût sur du travail courant, pas la capacité sur les tâches agentiques pour lesquelles SpaceXAI a optimisé le modèle. Cinq limites :
- L'égalité de précision est un effet plafond, pas une preuve que 4.6 n'est pas plus intelligent. Nos tâches ont manqué de difficulté avant les modèles, et elles ne sondent pas le codage agentique de pointe sur le long terme.
- Deux à trois essais par tâche. Suffisant pour dégager une direction et une histoire de variance, pas un intervalle de confiance.
- Mesuré via OpenRouter, pas via l'endpoint propre de SpaceXAI. Le routage ajoute une latence qui n'est pas celle du modèle, ce qui explique pourquoi les comptes de tokens indépendants du fournisseur portent l'argument.
- Une tâche est allée à l'encontre de la thèse,
constraint_schedule, où 4.6 était plus rapide à la médiane. - La comparaison avec Claude a aussi saturé. Cinq tâches de codage, les trois modèles à 10/10, ce qui sépare bien le coût et la latence mais ne dit rien sur quel modèle est le plus fort au plafond.
Nous n'avons pas non plus testé ce que SpaceXAI affirme réellement : de meilleurs premiers essais sur les projets visuels et interactifs. Aucun correcteur déterministe n'existe pour cela, donc nous ne le contestons pas. Nous n'avons aucune relation commerciale avec SpaceXAI et avons payé chaque appel nous-mêmes.
Qui devrait passer à niveau, et qui devrait rester sur 4.5 ?
Passe à niveau si ton trafic relève du travail agentique long ; reste sur 4.5 si ce sont des appels structurés courts en volume. Sur l'axe de l'index que tout autre article de lancement utilise, 4.6 gagne à grille tarifaire identique. Sur le coût mesuré par réponse correcte, grok 4.6 vs grok 4.5 s'inverse.
| Ta charge de travail | Choix | Ce qui fait basculer |
|---|---|---|
| Appels structurés ou JSON à haut volume | Grok 4.5 | une tâche que 4.5 échoue réellement |
| Codage agentique long terme | Grok 4.6 | rien de ce que nous avons mesuré ; c'est son terrain |
| Parcours utilisateur sensibles à la latence | Grok 4.5 | l'appel avec une queue à 81.61 s, tant que l'effort n'est pas plafonné |
| Sessions à forte réutilisation de cache | fais le calcul | $0.50 contre $0.30 par million peut effacer l'écart de tokens |
| Déjà sur 4.6 | reste, mais fixe l'effort | le laisser par défaut coûte 49% de tokens en sortie en plus |
Grok 4.5 reste le moyen le moins cher d'obtenir la même réponse sur du travail structuré courant. Cela ne veut pas dire que 4.6 est moins bon : il achète ses gains en réfléchissant plus longtemps, et sur des appels de production courants, cet échange est une hausse de coût sans gain de précision détectable de notre côté. Un argument de plus pour fixer une version de modèle dans une pile d'agents plutôt que de suivre latest.
Trois scripts, une clé OpenRouter et moins d'un dollar de crédit, c'est tout ce qu'il faut pour vérifier si ton trafic ressemble au nôtre.
Questions fréquentes
Existe-t-il un Grok 5 ou un Grok 5.6 ?
Aucun des deux n'existe. Au 12 août 2026, Grok 4.6 est le modèle le plus récent ayant été lancé. Grok 4.7 a été annoncé pour fin août ou début septembre et n'avait pas encore été lancé au moment où nous avons écrit cet article ; tout ce qui vient après vise la fin 2026. Le « 5.6 » est presque certainement GPT-5.6 Sol, un modèle OpenAI auquel Grok 4.6 est comparé en benchmark.
Grok 4.6 coûte-t-il plus cher que Grok 4.5 ?
Même grille tarifaire, $2/M en entrée et $6/M en sortie pour les deux. Nos 80 appels mesurés ont renvoyé des réponses identiques pour 1.38× le coût total, parce que 4.6 émet 1.90× la médiane de tokens en sortie. L'entrée en cache est aussi passée de $0.30 à $0.50 par million.
Grok 4.6 est-il plus lent que Grok 4.5 ?
À notre médiane, 1.26× plus lent : 5.25 s contre 4.17 s sur 40 appels chacun. Sur notre pire appel, 2.27× : 81.61 s contre 35.98 s. Artificial Analysis, en mesurant séparément, rapporte un temps jusqu'au premier token de 32.30 s contre 8.68 s. Note que nous avons mesuré via OpenRouter, donc le routage ajoute une latence dont le modèle lui-même n'est pas responsable.
Quelle est la fenêtre de contexte de Grok 4.6 et comment l'appeler ?
500K tokens, inchangée par rapport à Grok 4.5. Le slug est x-ai/grok-4.6 sur OpenRouter et grok-4.6 sur l'API SpaceXAI, avec une variante rapide au double du tarif standard. Fixe reasoning_effort explicitement plutôt que d'hériter de sa valeur par défaut ; celle-ci est high, et sur nos quatre tâches de contrôle, la faire passer à low a divisé par deux les tokens en sortie sans coûter une seule bonne réponse.
Dois-je rester sur Grok 4.5 ?
Pour un travail structuré à haut volume, oui : il a renvoyé les mêmes réponses pour moins cher sur les 80 appels. Pour le codage agentique long terme, la charge de travail pour laquelle SpaceXAI a optimisé 4.6, nos tâches ne tranchent pas la question et nous ne l'avons pas testée. Mesure ton propre trafic.