ai-machine-learning

Claude Sonnet 5.5: zelfde $2/$10, maar de 30% besparing zie je alleen bij lange taken

Geschreven door Mert Batur
Bijgewerkt Sep 29, 2026
8 leestijd
Claude Sonnet 5.5: zelfde $2/$10, maar de 30% besparing zie je alleen bij lange taken

Claude Sonnet 5.5: zelfde $2/$10, maar de 30% besparing zie je alleen bij lange taken

Anthropic bracht Claude Sonnet 5.5 op 28 september 2026 uit tegen precies de prijs van Sonnet 5: $2 per miljoen inputtokens, $10 per miljoen outputtokens. Een dag later stuurden we 19 beoordeelde calls via OpenRouter erdoorheen. Bij een lang HTML-bestand daalde de rekening met 11,1%. Bij een piepkleine factuursom steeg hij met 12,8%.

Zelfde prijs. Andere rekening.

Wat veranderde er toen Claude Sonnet 5.5 op 28 september uitkwam?

Wissel het model-id naar claude-sonnet-5-5 en je tarief per token blijft $2 input en $10 output.

Op Anthropics prijspagina staan Sonnet 5.5 en Sonnet 5 op identieke regels, inclusief cache en batch. Elk kostenverschil tussen de twee is dus een verschil in aantal tokens.

OnderdeelSonnet 5.5 bij de lancering
API-model-idclaude-sonnet-5-5
Input / output, per 1M tokens$2 / $10
Cache read / cache write$0.20 / $2.50 (5 min), $4 (1 uur)
Batch input / output$1 / $5
Context / max. output1M / 128K tokens
Standaard-effortMedium in Claude Code en de apps, High op de API
BeschikbaarheidZero data retention; AWS, Google Cloud, Microsoft Azure
GitHub CopilotPro, Pro+, Max, Business, Enterprise, tegen lijstprijs

Bronnen: Anthropics modelpagina van Sonnet 5.5, de lanceerpost en de changelog van GitHub. Achtergrond: wat Sonnet 5 veranderde en tokenprijzen per aanbieder.

Hoe dicht komt Sonnet 5.5 bij Opus 5.5 op Anthropics tabel?

Sonnet 5.5 blijft op vier van de zes procentrijen minder dan drie punten achter op Opus 5.5, en zijn ene winst valt binnen de foutmarge.

Cellen overgetypt uit de heroafbeelding:

BenchmarkSonnet 5.5Sonnet 5Opus 5.5GPT-6 Sol
Terminal-Bench 4.070,6%10,3%66,4%¹n.v.t.
FrontierCode 1.1 Main46,2% (Max)², 52,1% (Xhigh)42,4%54,4%49,3%
CursorBench 4.055,5%34,1%57,8%n.v.t.
GDPval-AA v2.1³1844144918461487⁴
AA-Briefcase v1.1³1811135918221483⁴
HLE (met tools)64,5%54,9%67,7%n.v.t.
OSWorld 2.1 (gedeeltelijk)80,1%57,0%81,8%n.v.t.
Chartography (zonder tools)61,6%15,6%64,4%53,6%⁴

¹ Opus op Xhigh-effort. ² Max scoorde lager dan Xhigh: het draaide meer code-review-subagents, en Cognition zag in twee gevallen time-outs of edits buiten de opdracht. ³ Uitgevoerd door Artificial Analysis op een pre-release-deployment met een bug in structured output, inmiddels opgelost. ⁴ Een afbeeldingsbug bij GPT-6 Sol is mogelijk niet verwerkt. Anthropics grafieken voor Terminal-Bench en CursorBench tonen GPT-5.6 Sol.

FrontierCode (Xhigh) en CursorBench blijven 2,3 punten achter, OSWorld 1,7, Chartography 2,8. HLE is de uitzondering met 3,2. De Elo-rijen liggen 2 en 11 uit elkaar.

Die Terminal-Bench-rij voedt de r/ClaudeCode-thread "Sonnet 5.5 beats Opus 5.5 at coding and it's half the price??". De system card geeft standaardfouten van ±2,5 en ±2,6 punten, dus het verschil van 4,2 punten is ongeveer 1,2 gecombineerde standaardfouten, en Sonnet draaide op max terwijl Opus op xhigh draaide. Artificial Analysis mat Sonnet 5.5 op dezelfde test op 64%. De grootste voorsprong van Opus staat niet op de lanceerpagina: SWE-Bench Pro, 81,3 tegen 89,9.

GPT-6 Sol is gewoon de kolom die Anthropic afdrukte. Voor de vergelijking van GPT-6 Astra met Opus 5.5 zie je onze test met drie modellen.

Houdt Anthropics 30% besparing stand over 19 API-calls?

Alleen bij de lange taak: 11,1% goedkoper op een HTML-taak met gemiddeld 2.564 outputtokens, 10-13% duurder op twee piepkleine taken.

Op 29 september om 14:25 UTC stuurden we 19 beoordeelde calls via OpenRouter naar Sonnet 5.5 en Sonnet 5: 3 taken, 3 pogingen, 2 modellen, plus één extra call op hoge effort. Totale rekening: $0.183434. Alle 18 gematchte calls slaagden.

python
# sonnet55_bench.py, 29 Sep 2026, POST https://openrouter.ai/api/v1/chat/completions
body = {
    "model": model,        # anthropic/claude-sonnet-5.5 or anthropic/claude-sonnet-5
    "messages": messages,
    "max_tokens": max_tokens,         # 12000 on the HTML task
    "reasoning": {"effort": effort},  # low: invoice, merge_intervals; medium: HTML
}

Geen enkel LLM beoordeelde iets. De factuur (800k cache-read-, 200k input- en 50k outputtokens) moest exact 1.06 opleveren, merge_intervals draaide 6 uitgevoerde asserts, en de HTML moest een doctype, canvas en requestAnimationFrame bevatten en geen extern script. Kosten zijn usage.cost, opgeteld over 3 pogingen.

Taak (effort)Sonnet 5.5Sonnet 5VerschilGem. outputtokensGem. latency
Factuur (low)$0.002754$0.002442+12,8%71 / 612,63 s / 4,49 s
merge_intervals (low)$0.006054$0.005502+10,0%172 / 1543,06 s / 3,68 s
HTML met 150 vogels (medium)$0.077508$0.087156-11,1%2.564 / 2.88615,54 s / 21,61 s
Gematcht totaal$0.086316$0.0951-9,2%n.v.t.n.v.t.

Anthropic belooft "up to 30% less per task than its predecessor". Matthias Bastian van The Decoder voegde het juiste voorbehoud toe: "Independent testing still needs to confirm these claims."

In onze meter van 19 calls op low en medium effort, met één lange taak, was de besparing -11,1% op de HTML en sloeg ze om naar +12,8% en +10,0% op de piepkleine taken. Bij dezelfde lijstprijs is elke besparing een aantal tokens, en op onze twee kleinste taken schreef Sonnet 5.5 méér tokens, niet minder.

De snelheid hield beter stand. De HTML-latency daalde met 28,1% en de doorvoer steeg van 133,5 naar 165,0 tokens per seconde (+23,6%): de goede kant op, iets onder de 30%. Sonnet 5 logde ook 54-63 reasoning-tokens per factuurcall; Sonnet 5.5 logde er 0 bij alle 10 calls.

Die HTML-taak is een versie met 150 vogels van Anthropics demoprompt met 400 spreeuwen op de lanceerpagina. De beelden hieronder zijn Anthropics opname, niet onze run.

Anthropics lanceerdemo: Claude Sonnet 5 is nog bezig met de zwerm van 400 spreeuwen, op 4.520 outputtokens
Anthropics lanceerdemo, 'A murmuration of 400 starlings in one HTML file': Sonnet 5 schrijft nog, op 4.520 tokens. Bron: Anthropic.

Anthropics lanceerdemo: Claude Sonnet 5.5 heeft de zwerm afgerond op 4.158 outputtokens
Dezelfde demo van Anthropic: Sonnet 5.5 is klaar op 4.158 tokens, de zwerm vliegt 12,5 s. Bron: Anthropic.

Wat Anthropics lanceringstesters meldden

"Without changing any of our prompts, Claude Sonnet 5.5 did better than Sonnet 5 on almost all of our offline Slackbot evals, in fewer steps and with about 14% fewer output tokens." Curtis Allen, Principal Engineer, Slack

"The new model managed tens of thousands of lines of code for gameplay system architecture, kept responses snappy, handled multi-hour tasks, and delivered with less prescriptive prompting." Daniel Vogel, Chief Operating Officer, Epic Games

Beide zijn door de leverancier verzameld en beide beschrijven lang, meerstaps werk. Onze piepkleine taken gingen de andere kant op.

Niet gemeten: agentic werk, de benchmarks hierboven, de cyber-fallback. Drie pogingen is een steekproef; wil je zelf meten, lees dan usage bij elke call uit.

Waarom verschuift de effort-stand de rekening meer dan het model?

Artificial Analysis mat $0.59 per taak op medium en $7.60 op max: een sprong van 13x voor 15 indexpunten.

Op max telde het "~193k Output Tokens per Intelligence Index Task. This is the highest token use we have measured".

EffortAA-kosten per taakAA Intelligence IndexAA-rang, 29 sep
Low$0.413663 van 216
Medium$0.594144 van 216
High$1.084723 van 216
Max$7.60563 van 216

De rijen komen van AA's modelpagina's per effort, opgehaald op 29 september. AA's lanceerartikel zette Sonnet 5.5 op de tweede plaats van de index; de modelpagina toonde die dag 56, rang 3 van 216. Max kostte ook "~50% higher than Sonnet 5's Cost per Task".

Onze eigen call op hoge effort negeerde de instelling: merge_intervals op effort=high kostte $0.002018 voor 172 outputtokens, identiek aan low. Effort bijt pas bij werk dat groot genoeg is om over na te denken, en daar begint je LLM-API-uitgaven verlagen.

Wat geeft een 400 nadat je het model-id hebt gewisseld?

Elk verzoek met uitgeschakelde thinking faalt; zet het op between_tools en houd effort op high of lager.

Anthropics migratiegids noemt de fout letterlijk:

python
# Before (Sonnet 5 habit): 400 invalid_request_error on claude-sonnet-5-5
thinking = {"type": "disabled"}
# '"thinking.type.disabled" is not supported for this model. Use
#  "thinking.type.between_tools" for the lowest thinking setting, ...'

# After: accepted at low / medium / high effort, 400 at xhigh / max
thinking = {"type": "between_tools"}
output_config = {"effort": "medium"}  # fixed for the conversation under between_tools
  1. tool_choice met any of tool geeft 400. Gebruik auto plus strict: true (maximaal 20 strict tools), of alleen auto op Amazon Bedrock.
  2. Thinking-blokken van Opus 5, Opus 5.5, Fable of Mythos worden stilzwijgend weggelaten; accounts van 31 aug 2026 of later krijgen een 400 als je een blok terugspeelt nadat je de geschiedenis hebt aangepast. De werking komt overeen met de thinking-block-binding van Fable 5.1.
  3. Computer use vereist computer_toolset_20260801 op de Claude API en Google Cloud.
  4. Weigeringen noemen een stop_details-categorie, waaronder cyber, frontier_llm ("could assist the development of competing AI models") en reasoning_extraction.
  5. Server-side fallback (fallbacks: "default", bèta, alleen Claude API) probeert cyber- en frontier_llm-weigeringen opnieuw op Sonnet 5; volgens de system card viel 1,2% van de Terminal-Bench-verzoeken terug.
  6. De minimale cachebare prompt zakt naar 512 tokens van 1.024 (minimumgroottes bij prompt caching), en /claude-api migrate in Claude Code past deze wijzigingen toe.

Securityteams lopen als eerste tegen punt 4 aan. Een HN-reageerder, johnmlussier, zei dat ze ondanks deelname aan het Cyber Verification Program "can't use Opus 5.5 or Sonnet 5.5 for any authorized bounty work". Anthropic zegt dat het uitgebreide programma "Soon" komt.

Dezelfde checklist zegt "Re-run your effort sweep, and re-baseline cost". Doe dat voordat je de 30% gelooft.

Sonnet 5.5 of Opus 5.5: welke krijgt de standaardplek?

Kies Sonnet 5.5 als standaard voor afgebakende codeertaken en grote volumes; houd Opus 5.5 voor open oordeelsvorming en al het werk op max-effort.

Sonnet staat op de helft van Opus 5.5's $4/$20, maar Artificial Analysis mat Sonnet op max op $7.60 per taak tegen $5.98 voor Opus 5.5, zo'n 27% meer.

SignaalSonnet 5.5Opus 5.5Voordeel
Input / output per 1M$2 / $10$4 / $20Sonnet, half zo duur
Cache read / 5-min write$0.20 / $2.50$0.20 / $5Gelijk bij reads
Cache-zware mix (hieronder)$1.06$1.96Sonnet, 1,85x en geen 2x
AA-kosten per taak, max effort$7.60$5.98Opus, 27% goedkoper
SWE-Bench Pro81,3%89,9%Opus met 8,6 punten
text
Mix: 800k cache-read + 200k input + 50k output tokens
Sonnet 5.5: 0.8 x $0.20 + 0.2 x $2 + 0.05 x $10 = $0.16 + $0.40 + $0.50 = $1.06
Opus 5.5:   0.8 x $0.20 + 0.2 x $4 + 0.05 x $20 = $0.16 + $0.80 + $1.00 = $1.96
Ratio: 1.96 / 1.06 = 1.85x

Aleksei Aleinikovs "approximately 1.65×" hangt af van een mix die hij niet noemt. Vul de jouwe in: hoe meer cache je gebruikt, hoe kleiner Sonnets voorsprong.

Anthropic zelf zegt "Opus 5.5 remains clearly stronger at complex, open-ended work requiring sustained judgment." Een HN-reageerder, datadrivenangel, zette er een schepje bovenop: "Opus 5.5 on Low seems smarter, cheaper, and faster than sonnet on medium". Door ons niet getest. Prijzen en limieten van Opus staan in onze uitleg over Opus 5.5.

Onze standaard sinds 29 september: claude-sonnet-5-5 op medium effort. Taken op max-effort gaan naar Opus 5.5, want op max is Sonnet niet langer het goedkope model.

Veelgestelde vragen

Wanneer is Claude Sonnet 5.5 uitgekomen?

Anthropic bracht Claude Sonnet 5.5 op 28 september 2026 uit als claude-sonnet-5-5, dezelfde dag op Amazon Web Services, Google Cloud, Microsoft Azure en GitHub Copilot. Volgens Anthropics documentatie wordt het niet vóór 28 september 2027 uitgefaseerd.

Is Claude Sonnet 5.5 goedkoper dan Sonnet 5?

Niet per token: beide staan op $2 input en $10 output. In onze meter kostte een lange HTML-taak 11,1% minder op Sonnet 5.5 en een piepkleine factuurtaak 12,8% meer; op max-effort mat Artificial Analysis ongeveer 50% meer per taak.

Kan ik Sonnet 5.5 gebruiken in Claude Code en GitHub Copilot?

Ja. Claude Code zet het standaard op Medium-effort; de API staat standaard op High. In GitHub Copilot, van Pro tot Enterprise, wordt het "billed at provider list pricing under usage-based billing". Wil je het vastzetten, lees dan hoe je van model wisselt in Claude Code.

Wat is het contextvenster en de knowledge cutoff van Sonnet 5.5?

Het verwerkt 1M tokens context en geeft tot 128K outputtokens terug, met een betrouwbare knowledge cutoff van juni 2026 volgens de system card.

Komt er een Haiku 5.5?

Op 29 september 2026 nog niet. Anthropic zei op 28 september dat Claude Haiku 5.5 "will join the Claude 5.5 family in the coming weeks."

Tags

claude sonnet 5.5sonnet 5.5 vs opus 5.5claude sonnet 5.5 prijsclaude-sonnet-5-5anthropic

Dit artikel delen

Start je project

Klaar om iets buitengewoons te bouwen?

Laten we je idee werkelijkheid maken. Ons team staat klaar om software te bouwen die het verschil maakt.