Techsy
Contact
Aan de slag
Terug naar Blog
ai-machine-learning

Gemma 4 12B: Benchmarks, VRAM-vereisten en lokaal draaien

Geschreven door Mert Batur Gürbüz
Bijgewerkt Jul 14, 2026
14 leestijd
Inhoudsopgave
Gemma 4 12B: Benchmarks, VRAM-vereisten en lokaal draaien

Google DeepMind lanceerde Gemma 4 12B op 3 juni 2026. Drie dagen later is het getal dat iedereen herhaalt de MMLU Pro-score: 77,2%. Dat verslaat de Gemma 3 27B van vorig jaar, die 67,6% haalde op dezelfde test. Een model met 12 miljard parameters dat een 27B-flagship overtreft? Bij minder dan de helft van het geheugen? Ja. En de licentie is ook veranderd. Gemma 4 valt onder Apache 2.0, commercieel gebruik is dus gewoon toegestaan, geen voorbehouden. Het heeft een contextvenster van 256K tokens en draait op ongeveer 6,6 GB VRAM na kwantisatie. Dat laatste is het hele verhaal voor de meesten: dit ding past op een mid-range GPU.

Belangrijkste punten

  • Gemma 4 12B (uitgebracht op 3 juni 2026) scoort 77,2% op MMLU Pro, beter dan Gemma 3 27B (67,6%).
  • Draait op ~6,6 GB VRAM bij Q4KM, past op een 8GB GPU; ~16GB geeft comfortabele ruimte.
  • Apache 2.0-licentie (commercieel gebruik OK), 256K context, native audio- en beeldinvoer, encoder-free architectuur.
  • Eén commando om het te starten: ollama run gemma4:12b (7,6 GB download).

Wat is Gemma 4 12B?

Gemma 4 12B is een open-weights model met 12 miljard parameters van Google DeepMind, uitgebracht op 3 juni 2026 onder een Apache 2.0-licentie. Het is een encoder-free, unified multimodaal model: tekst, afbeeldingen en native audio gaan erin, tekst komt eruit. Het heeft een contextvenster van 256K tokens en ondersteunt 140 talen.

De instruction-tuned variant die je in de praktijk gebruikt heet gemma-4-12B-it (de "it" staat voor instruction-tuned, de chatklare versie). Het heeft in totaal 11,95 miljard parameters, dus "12B" is licht afgerond naar boven. De trainingsdata loopt tot een afkappunt in januari 2025.

Dit is het interessante deel: Gemma 4 12B is de eerste middelgrote Gemma met native audio-invoer. Er is geen aparte audio-encoder bij vastgeklonken. Ruwe golfvormen worden rechtstreeks in het model geprojecteerd. Hetzelfde geldt voor afbeeldingen. Die ontwerpkeuze is de reden dat het klein genoeg blijft om op één consumentenkaart te draaien, en we komen zo meteen op de reden daarvoor.

Wil je eerst het grotere plaatje? Onze gids over open modellen lokaal draaien behandelt de basis als je nieuw bent met lokale LLM's. Google's officiële aankondiging heeft de volledige details.

Gemma 4 12B: specificaties in één oogopslag

Alles geverifieerd, in één tabel. Geen giswerk.

SpecificatieWaarde
Volledige naamGemma 4 12B (gemma-4-12B-it)
Parameters11,95B (~12B)
LicentieApache 2.0 (commercieel gebruik OK)
Contextvenster256K tokens
ModaliteitenTekst + afbeelding + native audio in, tekst uit
ArchitectuurEncoder-free unified, 48 lagen, hybride attention
Talen140
TrainingsafkappuntJanuari 2025
Ollama-taggemma4:12b (7,6 GB download)
Apple Silicon-taggemma4:12b-mlx
Aanbevolen samplingtemperature 1.0, top_p 0.95, top_k 64

Een noot over sampling: hou je aan de aanbevolen temperature=1.0, top_p=0.95, top_k=64 tenzij je een goede reden hebt om af te wijken. Gemma-modellen gedragen zich vreemd bij lage temperaturen, dus zet die niet reflexmatig op 0.2 zoals je bij andere modellen misschien zou doen.

Hoe werkt de encoder-free architectuur?

Encoder-free betekent dat er geen apart model is dat afbeeldingen of audio verwerkt vóór ze de taalmodel bereiken. Visuele patches en ruwe audiogolfvormen worden via dunne lineaire lagen direct in de gedeelde embeddingsruimte geprojecteerd. De meeste multimodale modellen koppelen een zware vision encoder aan het LLM. Gemma 4 12B slaat dat over, en daarom past het in 16GB.

Vergelijk het met een tolk versus een tweetalig persoon. De oude aanpak huurt een aparte tolk in (de encoder) om afbeeldingen te vertalen naar een taal die het model begrijpt, en geeft dat vervolgens door. Gemma 4 12B is tweetalig van geboorte. Audio- en beelddata spreken de eigen taal van het model rechtstreeks, via een lichtgewicht projectielaag in plaats van een logge encoder.

Onder de motorkap zitten 48 lagen met hybride attention. De meeste lagen gebruiken een sliding window van 1024 tokens (goedkoop, lokaal), afgewisseld met globale attention-lagen die de hele context zien. Die mix is hoe het een contextvenster van 256K aankan zonder je GPU te smelten.

Architectuurdiagram zonder encoder: ruwe audio en beeldpatches worden direct geprojecteerd in de Gemma 4 12B embeddingsruimte
Hoe Gemma 4 12B audio- en beelddata direct in het model voedt zonder aparte encoder

Het praktische voordeel: minder parameters voor encoders betekent dat meer van je VRAM-budget naar het eigenlijke redeneren gaat. Dat is de ruil die een 12B-model zo ver boven zijn gewichtsklasse laat stoten.

Gemma 4 12B benchmarks: de echte cijfers

De kop klopt: Gemma 4 12B scoort 77,2% op MMLU Pro, beter dan de 67,6% van Gemma 3 27B op dezelfde test, bij minder dan de helft van het VRAM. Dit zijn de officiële instruction-tuned (-it) cijfers van Google, geen schattingen van de community. Hier is de volledige set.

BenchmarkGemma 4 12BGemma 3 27B (referentie)
MMLU Pro77,2%67,6%
GPQA Diamond78,8%—
MMMU Pro69,1%—
AIME 2026 (zonder tools)77,5%—
LiveCodeBench v672,0%—
Codeforces ELO1659—

Een 12B-model verslaat nu het 27B-flagship van vorig jaar op MMLU Pro: 77,2% vs 67,6%. Dat is het soort generatiesprong waarbij je je hardwarerekening heroverweegt.

Staafdiagram waarin Gemma 4 12B wordt vergeleken met Gemma 3 27B en Gemma 3 12B op de MMLU Pro benchmark
Gemma 4 12B vs Gemma 3 27B vs Gemma 3 12B op MMLU Pro — het kleinere nieuwe model scoort het hoogst

Twee eerlijke kanttekeningen. Ten eerste: de streepjes betekenen dat Google geen Gemma 3 27B-cijfer heeft gepubliceerd voor die rijen, dus die cellen blijven leeg in plaats van gevuld met giswerk. Ten tweede: alle scores hier zijn van het instruction-tuned model. De basismodelcijfers wijken af. Je kunt dit alles narekenen op de HuggingFace-modelkaart en de DeepMind-modelpagina.

Hoeveel VRAM heeft Gemma 4 12B nodig?

Gemma 4 12B heeft ongeveer 6,6 GB VRAM nodig bij Q4KM-kwantisatie, wat betekent dat het op een 8GB GPU past. Voor comfortabele ruimte, zeker als je een flink deel van dat 256K-contextvenster wilt gebruiken, streef je naar 16GB VRAM of unified memory. Het draait op een laptop. M-series Macs doen het via unified memory prima.

Kwantisatie is gewoon compressie voor modelgewichten. Lagere precisie, kleiner bestand, iets minder nauwkeurigheid. Hier is hoe de gangbare niveaus zich verhouden.

KwantisatieVRAM (circa)KwaliteitHet beste voor
Q4_K_M~6,6 GBBijna volledig, minimaal verliesDe verstandige standaard; past op 8GB kaarten
Q5_K_M~8,5 GBIets beter dan Q4Wat extra VRAM beschikbaar, meer nauwkeurigheid gewenst
Q8~13 GBEffectief volledige kwaliteit16GB+ kaarten, maximale getrouwheid
QAT Q4_0~6,6 GBBijna-FP bij Q4-voetafdrukBeste kwaliteit per GB (uitgebracht op 5 juni)

Horizontaal staafdiagram van het VRAM-gebruik van Gemma 4 12B per kwantisatieniveau met referentielijnen bij 8GB en 16GB
VRAM-voetafdruk van Gemma 4 12B per kwantisatieniveau, met 8GB en 16GB GPU als referentie

Als je hardware wilt kiezen op basis van dit model, behandelt onze vergelijking van lokale LLM-tools die we hebben doorgelicht welke backends het meeste uit een bepaalde kaart halen. De korte versie: een 12GB kaart draait Q4 met ruimte over, een 8GB kaart draait Q4 als je de context bescheiden houdt.

Gemma 4 12B snelheid: tokens/sec op echte hardware

Hoe snel is het? Dat hangt af van je kaart, je kwantisatie en je backend, dus in plaats van één getal hebben we de gepubliceerde cijfers van derden op één plek verzameld. Dit zijn gerapporteerde cijfers van community-testers en leveranciers, met attributie per bron. Het zijn geen eigen labmetingen.

HardwareKwantGerapporteerde tokens/secBron
RTX 3060 (6GB)Q4_K_M~6,6 GB VRAM-voetafdruk, draait lokaal (tok/s niet precies gerapporteerd)runaiathome
RTX 4090 (24GB)Q4_K_MReal-time-chat-bereik (specifiek tok/s nog niet gerapporteerd)apxml / community
Apple M-series (unified)mlx / Q4Draait via gemma4:12b-mlx (tok/s nog niet breed gerapporteerd)Ollama / community

Om eerlijk te zijn over wat de publieke data op dit moment werkelijk zegt: runaiathome bevestigde dat het model draait op een 6GB RTX 3060 binnen zijn ~6,6 GB Q4KM-voetafdruk — dat is het meest concrete gepubliceerde hardwarerapport tot nu toe. De specificatiesheet van apxml en de Ollama-bibliotheekpagina bevestigen dat het model lokaal draait op een 24GB RTX 4090 bij Q4, comfortabel in real-time-chat-territorium, maar een precies gemiddeld tok/s-cijfer is voor die kaart nog niet gepubliceerd. De Apple Silicon gemma4:12b-mlx-variant bestaat en draait, maar betrouwbare tok/s-cijfers zijn drie dagen na de lancering nog niet opgedoken.

Wat dit betekent per categorie: op een 6GB kaart zoals de RTX 3060 kun je het laden en gebruiken voor lokale chat, hou je contextvenster alleen bescheiden. Op een 24GB RTX 4090 bij Q4KM plaatsen gepubliceerde rapporten het comfortabel in real-time-chat-territorium. Op Apple Silicon draait de MLX-build, maar benchmarkcijfers zijn nog onderweg.

Dit zijn gepubliceerde cijfers van derden, geen eigen labmetingen — behandel ze als richtlijn. Je tok/s hangt af van promptlengte, contextgrootte en backend-versie. Bronnen: de Ollama-bibliotheekpagina, apxml en runaiathome. Zodra de komende twee weken meer community-benchmarks binnenkomen, werken we deze tabel bij.

Hoe draai je Gemma 4 12B lokaal?

De kortste weg: installeer Ollama, voer één commando uit, klaar. ollama run gemma4:12b haalt het model van 7,6 GB op en zet je in een chatprompt. Geen configuratiebestanden, geen Python-omgeving. Als je meer controle wilt of op Apple Silicon zit, zijn er hieronder vier andere manieren.

1. Ollama (de makkelijke standaard). Ophalen en starten in twee regels:

bash
ollama pull gemma4:12b
ollama run gemma4:12b

2. llama.cpp met een GGUF. Als je een specifieke kwantisatie wilt, wijs llama.cpp naar een GGUF op HuggingFace. GGUF is het bestandsformaat dat llama.cpp gebruikt voor gekwantiseerde gewichten:

bash
llama-cli -hf unsloth/gemma-4-12b-it-GGUF:Q4_K_M -p "Explain encoder-free models in one paragraph."

3. MLX op Apple Silicon. M-series Macs krijgen een speciale MLX-build die Apple's framework gebruikt in plaats van CUDA:

bash
ollama run gemma4:12b-mlx

4. LM Studio (GUI, geen terminal). Liever een desktopapp? Open LM Studio, klik op het zoektabblad en typ gemma 4 12b. Kies een Q4KM GGUF en download. LM Studio regelt de rest, inclusief een lokale server-toggle.

5. Bevraag het via de API. Ollama biedt een OpenAI-compatibel endpoint op poort 11434, dus bestaande code werkt met één aanpassing van de basis-URL:

bash
curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemma4:12b",
    "messages": [{"role": "user", "content": "Summarize the 256K context window in one sentence."}]
  }'

Zodra je het op de CLI hebt draaien, wil je waarschijnlijk een fatsoenlijke interface. Je kunt het in een ChatGPT-achtige UI met Open WebUI zetten in zo'n vijf minuten. Nieuw hiermee? Begin met onze volledige installatiegids voor lokale LLM's. Voor de officiële sampling-aanbevelingen en manieren om het te draaien, zie ai.google.dev en de Ollama-documentatie.

Welke kwantisatie moet je gebruiken voor Gemma 4 12B?

Voor de meeste mensen is Q4KM de verstandige standaard: ongeveer 6,6 GB VRAM, bijna volledige kwaliteit en het past op een 8GB GPU. Als je 16GB of meer hebt en maximale getrouwheid wilt, stap dan over naar Q8. En als je op dit moment de beste kwaliteit per gigabyte wilt, kijk dan naar de nieuwe QAT Q4_0-checkpoints.

Hier is een verse hoek die nog nauwelijks is opgepikt. Op 5 juni 2026, slechts twee dagen na de lancering, bracht Google Quantization-Aware-Training (QAT) Q4_0-checkpoints uit samen met een nieuw mobiel formaat. QAT betekent dat het model is getraind met kwantisatie in gedachten, zodat het bijna-FP-kwaliteit (bijna volledige precisie) behoudt bij een Q4-voetafdruk. Hetzelfde ~6,6 GB, merkbaar minder nauwkeurigheidsverlies dan standaard post-training Q4. Als je VRAM-beperkt bent maar kwaliteitsgevoelig, is dat jouw keuze.

Snelle beslissingsgids:

  • 8GB kaart, wil het simpel: Q4KM.
  • 8GB kaart, beste kwaliteit op die grootte: QAT Q4_0.
  • 16GB+ kaart, maximale getrouwheid: Q8.
  • Daartussenin, wat extra VRAM beschikbaar: Q5KM.

Je kunt Google's redenering lezen in hun QAT-aankondiging. De conclusie: Q4KM is prima, QAT Q4_0 is beter op dezelfde grootte en Q8 heb je alleen nodig als nauwkeurigheid zwaarder weegt dan geheugen.

Gemma 4 12B vs Gemma 3 12B vs Qwen 3.5: is de upgrade de moeite waard?

Ja, de upgrade van Gemma 3 12B is de moeite waard als je om de Apache 2.0-licentie geeft, native audio-invoer, het 256K-contextvenster of de MMLU Pro-sprong. Vergeleken met Qwen 3.5 is het minder eenzijdig. Gemma 4 12B wint op licentie-permissiviteit en native audio, maar Qwen 3.5 wint sommige 12B-klasse benchmark-rijen. Kies op je werkelijke behoeften, niet op de kop.

KenmerkGemma 4 12BGemma 3 12BQwen 3.5 (12B-klasse)
LicentieApache 2.0Aangepaste Gemma-licentieApache 2.0
Context256K128KTot 256K
ModaliteitenTekst + afbeelding + audioTekst + afbeeldingTekst + afbeelding
Native audioJaNeeNee
MMLU Pro77,2%LagerCompetitief, wint sommige rijen
Q4 VRAM~6,6 GB~6,6 GB~6,6 GB

De licentiewijziging alleen al rechtvaardigt de overstap van Gemma 3 12B voor veel teams. Gemma 3 werd geleverd onder Google's aangepaste licentie met gebruiksbeperkingen; Gemma 4 is gewoon Apache 2.0. Als je Gemma om commerciële redenen had laten liggen, is die blokkade verdwenen.

Vergeleken met Qwen 3.5: wees eerlijk met jezelf. Qwen 3.5 is echt sterk en haalt Gemma 4 12B in op bepaalde redeneer- en coderingsrijen. Als audio-invoer en een permissieve licentie niet op je lijstje staan, benchmark dan beide op je eigen taak voordat je kiest. Bekijk waar Gemma 4 12B staat tussen de beste open modellen voor het bredere veld. En omdat het Apache 2.0 is, kun je het fine-tunen onder Apache 2.0 met Unsloth zonder licentiegedoe.

Wanneer moet je Gemma 4 12B niet gebruiken?

Sla Gemma 4 12B over als je frontier-niveau redenering nodig hebt die alleen een veel groter model levert, als Qwen 3.5 de specifieke benchmark-rij wint waarvan jouw werkdruk afhankelijk is, of als je project zwaar leunt op audio-tooling die drie dagen na de lancering nog volop in ontwikkeling is. Het is een uitstekend 12B-model, geen tovermiddel.

Gemma 4 12B is niet altijd de juiste keuze. Als je frontier-niveau redenering nodig hebt, wint een groter model nog steeds. De native audio-ondersteuning is echt en indrukwekkend, maar de bijbehorende tooling — bibliotheken, hulpprogramma's, framework-integraties — is pas enkele dagen oud en op plekken ruw. Als je deze week een audio-zwaar product lanceert, test dan grondig voordat je erop vertrouwt.

Nog een paar eerlijke uitsluitingsgronden. Als je het in een agent wilt integreren, controleer dan eerst de betrouwbaarheid van tool-calling op jouw taken, want agentisch gedrag verschilt per model. Als je voordeel het lange contextvenster is, zorg er dan voor dat je de 256K tokens optimaal benut in plaats van ervan uit te gaan dat een groter venster automatisch betere uitvoer geeft. En als je van lokaal draaien overgaat op productie-serving, behandelt de productie-serving weg voorbij lokaal vLLM en SGLang. Zet je Gemma 4 12B in productie in? Wij helpen je graag verder.

Over de auteur

Mert Batur Gurbuz is medeoprichter van Techsy.io, waar het team AI-agents, automatiseringssystemen en voice/SDR-pipelines bouwt voor B2B-klanten. Hij studeert aan de University of Birmingham en schrijft over de LLM-toolingstack die het Techsy-team daadwerkelijk in productie gebruikt. Verbind op LinkedIn.

Een tool kiezen is het makkelijke deel. Hem betrouwbaar in een echt product laten draaien, daar lopen de meeste teams vast, en dat is precies wat ons AI-integratieteam voor klanten bouwt, van RAG-pipelines tot maatwerkagents.

Veelgestelde vragen

Hoe draai ik Gemma 4 12B lokaal?

Installeer Ollama en voer ollama run gemma4:12b uit. Dat haalt het model van 7,6 GB op en opent een chatprompt. Geen Python-omgeving of configuratiebestanden nodig. Als je liever een grafische app gebruikt, werkt LM Studio ook: zoek gemma 4 12b in de modelbrowser en download een Q4KM-build.

Wat zijn de VRAM- en hardwarevereisten voor Gemma 4 12B?

Gemma 4 12B heeft ongeveer 6,6 GB VRAM nodig bij Q4KM-kwantisatie, dus het past op een 8GB GPU. Voor comfortabele ruimte, zeker bij gebruik van de lange context, streef je naar 16GB VRAM of unified memory. Het draait op laptops, inclusief M-series Macs via unified memory.

Kan Gemma 4 12B draaien op een 16GB laptop?

Ja, makkelijk. Bij Q4KM gebruikt het model ongeveer 6,6 GB, wat ruimschoots past op een 16GB machine. Op Apple Silicon-laptops verwerkt het unified memory het prima via de gemma4:12b-mlx-build. Op 16GB kun je zelfs overstappen naar Q8-kwantisatie voor hogere getrouwheid.

Is Gemma 4 12B werkelijk beter dan Llama of Qwen 3.5?

Het hangt ervan af wat je meet. Gemma 4 12B wint op de Apache 2.0-licentie, native audio-invoer en een 256K-contextvenster, en haalt een sterke 77,2% op MMLU Pro. Maar Qwen 3.5 wint sommige 12B-klasse rijen voor redeneren en codering. Benchmark beide op je eigen taak voordat je beslist.

Is Gemma 4 12B beter dan Gemma 3 12B?

Ja. Gemma 4 12B stapt over op de permissieve Apache 2.0-licentie, voegt native audio-invoer toe, verdubbelt het contextvenster naar 256K tokens en boekt een duidelijke MMLU Pro-verbetering. De licentiewijziging alleen al rechtvaardigt de upgrade voor commerciële projecten die geblokkeerd waren door de aangepaste voorwaarden van Gemma 3.

Welke kwantisatie moet ik gebruiken voor Gemma 4 12B?

Q4KM is de verstandige standaard bij ongeveer 6,6 GB en bijna volledige kwaliteit. Als je de beste kwaliteit op diezelfde grootte wilt, gebruik dan de nieuwe QAT Q4_0-checkpoints die op 5 juni 2026 zijn uitgebracht, die bijna-volledige-precisie-kwaliteit bieden bij een Q4-voetafdruk. Gebruik Q8 alleen als je 16GB+ hebt en maximale getrouwheid nodig hebt.

Is Gemma 4 12B gratis voor commercieel gebruik?

Ja. Gemma 4 12B valt onder de Apache 2.0-licentie, die commercieel gebruik toestaat zonder de gebruiksbeperkingen van de aangepaste Gemma-licentie van Gemma 3. Je kunt er commerciële producten mee bouwen, het fine-tunen en herdistribueren. Die licentiewijziging is een van de grootste redenen waarom teams upgraden van Gemma 3.

Ondersteunt Gemma 4 12B werkelijk audio-invoer?

Ja. Gemma 4 12B is de eerste middelgrote Gemma met native audio-invoer. Dankzij het encoder-free ontwerp worden ruwe audiogolfvormen direct in het model geprojecteerd zonder aparte audio-encoder. Dat gezegd: de bijbehorende tooling is nog maar een paar dagen oud, test dus zorgvuldig voordat je audio-zware functies in productie neemt.

Hoe snel is Gemma 4 12B op een RTX 4090?

Gepubliceerde rapporten van derden plaatsen Gemma 4 12B bij Q4KM comfortabel in real-time-chat-territorium op een 24GB RTX 4090, maar een precies gemiddeld tokens/sec-cijfer is nog niet gepubliceerd drie dagen na de lancering. De snelheid varieert met promptlengte, contextgrootte en backend-versie, dus behandel vroege cijfers als richtlijn.

Waar download ik Gemma 4 12B?

Het instruction-tuned model staat op HuggingFace als google/gemma-4-12B-it, of je kunt het ophalen via Ollama met ollama run gemma4:12b (een download van 7,6 GB). LM Studio-gebruikers kunnen gemma 4 12b zoeken in de modelbrowser van de app. Voor specifieke kwantisaties zijn GGUF-bestanden beschikbaar via community-repos zoals Unsloth.

Tags

gemma 4 12bollamalokale llmkwantisatiegemma

Dit artikel delen

Gerelateerde artikelen

Meer in ai-machine-learning

ai-machine-learning
Jul 20, 2026

Prompt Engineering voor Code: 7 Patronen die We Dagelijks Gebruiken in Claude Code en Cursor (2026)

De meeste artikelen over 'AI coding prompts' geven je 50 templates om te kopiëren. Dit artikel leert je de 7 patronen die we elke dag gebruiken om een 16-agent Claude Code pipeline te draaien, met een echte voor-en-na voor elk patroon, plus waar elk patroon leeft in Claude Code, Cursor en Copilot in 2026.

11 min read leestijd
Lezen
ai-machine-learning
Jul 20, 2026

8 Beste AI Web Scraping API's in 2026 (Getest op Onze Eigen Agent-Stack)

We hebben 8 AI web scraping API's getest met echte 2026-prijzen, opgehaald via onze eigen agent-stack. Firecrawl, Bright Data, ScrapingBee en 5 andere, gerangschikt op LLM-klare output, anti-bot-prestaties en MCP-ondersteuning.

9 min leestijd leestijd
Lezen
ai-machine-learning
Jul 19, 2026

Chain of Thought Prompting in 2026: Wanneer Het Helpt, Wanneer Het Tegenwerkt

Chain of thought prompting verhoogt in 2026 nog steeds de nauwkeurigheid bij sommige modellen, maar schaadt andere juist stilletjes. Redeneermodellen zoals GPT-5 en Claude doen dit al intern, waardoor handmatig 'denk stap voor stap' vaak overbodig is. Hier lees je precies wanneer je CoT wel en niet gebruikt, en hoe je dat bepaalt, met de eigen documentatie van OpenAI en Anthropic.

11 min leestijd leestijd
Lezen
Alle berichten bekijken
Start je project

Klaar om iets buitengewoons te bouwen?

Laten we je idee werkelijkheid maken. Ons team staat klaar om software te bouwen die het verschil maakt.

Plan een scoping-call van 30 minBekijk ons werk

Net uit de bibliotheek

Resources

Alles bekijken
  • Het Software Procurement Playbook

    Een herbruikbaar raamwerk om software in te kopen zonder zes maanden en een miljoen euro te verbranden aan het verkeerde platform.

  • Het Architecture Decision Playbook

    Een praktisch raamwerk om je stack te kiezen: wanneer zelf bouwen of inkopen, monoliet of microservices, en hoe je ontwerp op basis van een mooi cv vermijdt.

  • Het Vendor Selection Playbook

    Hoe je de juiste ontwikkelpartner kiest, of het nu een bureau, freelancer of intern team is, zonder te veel te betalen of met een half product te blijven zitten.

Claude Skills

Alles bekijken
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI-Automatiseringen

Alles bekijken
  • Security Auditor

    Wekelijkse SCA- + IaC-scan met geprioriteerde fix-PR's.

  • Cold Email Writer

    Genereert eerste-contactmails, verankerd in één concreet openbaar detail.

  • Lead Research Agent

    Verrijkt een e-mail tot een profiel, scoort de fit en meldt het in Slack.

Net uit de bibliotheek

Resources

Alles bekijken
  • Het Software Procurement Playbook

    Een herbruikbaar raamwerk om software in te kopen zonder zes maanden en een miljoen euro te verbranden aan het verkeerde platform.

  • Het Architecture Decision Playbook

    Een praktisch raamwerk om je stack te kiezen: wanneer zelf bouwen of inkopen, monoliet of microservices, en hoe je ontwerp op basis van een mooi cv vermijdt.

  • Het Vendor Selection Playbook

    Hoe je de juiste ontwikkelpartner kiest, of het nu een bureau, freelancer of intern team is, zonder te veel te betalen of met een half product te blijven zitten.

Claude Skills

Alles bekijken
  • New Post

    Full SEO blog pipeline: research, brief, write, validate, image, translate, publish to Sanity. Autonomous from start to finish.

  • Content Refresh

    Audit a stale post, find decay drivers, and ship a SERP-aligned refresh without losing existing rankings.

  • SEO Audit

    Site-wide SEO audit with prioritized fix list: technical, on-page, and EEAT signals.

AI-Automatiseringen

Alles bekijken
  • Security Auditor

    Wekelijkse SCA- + IaC-scan met geprioriteerde fix-PR's.

  • Cold Email Writer

    Genereert eerste-contactmails, verankerd in één concreet openbaar detail.

  • Lead Research Agent

    Verrijkt een e-mail tot een profiel, scoort de fit en meldt het in Slack.

Diensten

  • Enterprise-oplossingen
  • Mobiele apps
  • Webapplicaties

Oplossingen

  • CRM-systemen
  • AI-integratie
  • ERP-oplossingen
  • Voice Agents
  • Procesautomatisering
  • Cybersecurity

Bibliotheek

  • Resources
  • Blog
  • Portfolio

Community

  • AI-Automatiseringen
  • Claude Skills

Tools

  • Kostencalculator mobiele app
  • Kostencalculator OpenAI / LLM API
  • Kostencalculator MVP
  • Kostencalculator voice-AI-agent

Bedrijf

  • Over ons
  • Partners
  • Contact

Juridisch

  • Privacybeleid
  • Gebruiksvoorwaarden
  • Cookiebeleid

Diensten

  • Enterprise-oplossingen
  • Mobiele apps
  • Webapplicaties

Oplossingen

  • CRM-systemen
  • AI-integratie
  • ERP-oplossingen
  • Voice Agents
  • Procesautomatisering
  • Cybersecurity

Bibliotheek

  • Resources
  • Blog
  • Portfolio

Community

  • AI-Automatiseringen
  • Claude Skills

Tools

  • Kostencalculator mobiele app
  • Kostencalculator OpenAI / LLM API
  • Kostencalculator MVP
  • Kostencalculator voice-AI-agent

Bedrijf

  • Over ons
  • Partners
  • Contact
JuridischPrivacybeleidGebruiksvoorwaardenCookiebeleid
TECHSY
© 2026 Techsy. Alle rechten voorbehouden.