TL;DR
- Wat: Google DeepMind bracht Gemini 3.6 Flash uit — een AI-model dat beter scoort op benchmarks én 17% minder tokens verbruikt dan 3.5 Flash.
- Waarom relevant: lagere tokenkosten betekenen lagere AI-rekeningen, vooral als je AI inzet voor geautomatiseerde werkprocessen.
- Wat je ermee kunt: bekijk of je huidige AI-workflows op Flash draaien en reken uit wat de besparing per taak is.
Google DeepMind lanceerde gisteren, 21 juli 2026, Gemini 3.6 Flash. Wat mij opviel aan de aankondiging: het model scoort op vrijwel alle benchmarks hoger dan zijn voorganger, terwijl het tegelijk zuiniger omgaat met tokens. Ik vind dat een combinatie die het waard is om even bij stil te staan — zeker als je als ondernemer al betaalt voor AI-gebruik via een API.
Wat is er precies veranderd?
Gemini 3.6 Flash bouwt voort op Gemini 3.5 Flash en is volgens Google direct gebaseerd op gebruikersfeedback. De belangrijkste verbeteringen op een rij:
- Tokenverbruik: gemiddeld 17% minder output-tokens dan 3.5 Flash. Op complexere taken, zoals softwareontwikkeling, loopt dat verschil op tot 65% minder tokens.
- Prijs: $1,50 per miljoen input-tokens en $7,50 per miljoen output-tokens. Ter vergelijking: bij 3.5 Flash betaalde je nog $9 per miljoen output-tokens.
- Kennisgrens: verschoven van januari 2025 naar maart 2026. Dat klinkt als een detail, maar het betekent dat het model nu antwoorden kan geven over zaken die ruim een jaar recenter zijn.
- Context: het model verwerkt tot 1 miljoen input-tokens en kan tot 64.000 tokens als output genereren.
Even voor de duidelijkheid: een "token" is ruwweg een stukje tekst van zo'n vier tekens. Een A4'tje vol tekst is ongeveer 500 tokens. Als je dus een miljoen tokens als invoer kunt meegeven, kun je het model in één keer honderden pagina's laten verwerken.
Benchmarks: de cijfers achter de claims
Google deelt concrete benchmarkscores, en die zijn inmiddels door meerdere techsites bevestigd. Ik zet de opvallendste naast elkaar:
| Benchmark | 3.5 Flash | 3.6 Flash |
|---|---|---|
| DeepSWE (software engineering) | 37% | 49% |
| MLE Bench (ML-onderzoek) | 49,7% | 63,9% |
| OSWorld-Verified (computer use) | 78,4% | 83,0% |
| GDPval-AA v2 (kenniswerk) | 1.349 | 1.421 |
| GDM-MRCR v2 bij 1M tokens (lange context) | 27% | 54% |
Wat mij hier opvalt: de sprong op lange-context-taken is enorm — van 27% naar 54%. Dat is relevant als je grote hoeveelheden tekst door een model wilt halen, bijvoorbeeld contracten, handleidingen of klantcorrespondentie.
De verbeteringen op softwareontwikkeling (DeepSWE) zijn ook fors: van 37% naar 49%. Nu zijn benchmarks altijd een momentopname en niet één-op-één vertaalbaar naar de praktijk, maar de richting is duidelijk.
Wat betekent dit voor je portemonnee?
Hier wordt het concreet. De combinatie van lagere tokenprijzen én minder tokenverbruik per taak levert een dubbel effect op. Volgens analyses van onder andere VentureBeat daalt de effectieve kostprijs per voltooide taak met ongeveer 31%. Op zwaardere taken, zoals geautomatiseerd coderen, kan dat oplopen tot zo'n 71%.
Stel dat je als ondernemer een AI-toepassing draait die dagelijks klantvragen beantwoordt, documenten samenvat of offertes genereert. Dan betaal je per API-aanroep op basis van tokenverbruik. Een model dat hetzelfde resultaat levert met minder tokens is dan simpelweg goedkoper — zonder dat je iets aan je workflow hoeft te veranderen.
Google bracht tegelijk ook Gemini 3.5 Flash-Lite uit, een nog lichtere variant voor $0,30 per miljoen input-tokens en $2,50 per miljoen output-tokens. Die is bedoeld voor taken waar snelheid en volume belangrijker zijn dan maximale kwaliteit, zoals het doorzoeken van grote documentarchieven of het verwerken van gestructureerde data.
Vergelijking met de concurrentie
Ik vind het eerlijk gezegd bijzonder hoe snel de prijzen in deze markt dalen. Een jaar geleden betaalde je voor vergelijkbare prestaties al snel het dubbele of meer. De concurrentie tussen Google, OpenAI en Anthropic drijft de prijs per token steeds verder omlaag. Voor ondernemers die AI via een API inzetten is dat goed nieuws — je krijgt meer voor minder.
Minder stappen, minder gedoe
Een detail dat minder aandacht krijgt maar dat ik interessant vind: Google zegt dat 3.6 Flash minder "reasoning steps" en tool calls nodig heeft om meerstapstaken af te ronden. In gewone taal: het model hoeft minder na te denken en minder vaak externe hulpmiddelen aan te roepen om tot een antwoord te komen.
Kun je je voorstellen wat dat betekent als je AI inzet voor een proces met meerdere stappen? Denk aan een klantvraag die eerst moet worden geclassificeerd, dan gekoppeld aan een productdatabase, en vervolgens beantwoord. Elke stap kost tokens, elke tool call kost tijd. Minder stappen betekent sneller en goedkoper.
Cyber-variant voor beveiliging
Google lanceerde ook een gespecialiseerde variant: Gemini 3.5 Flash Cyber. Dit model is ontworpen voor het opsporen en verhelpen van beveiligingskwetsbaarheden. Het is voorlopig alleen beschikbaar via een beperkt pilotprogramma voor overheden en geselecteerde partners. Ik noem het hier omdat het laat zien hoe Google steeds meer gespecialiseerde modellen naast de algemene varianten zet — een trend die ik voor ondernemers relevant vind. Het suggereert dat we steeds vaker modellen zullen kiezen op basis van de specifieke taak, niet één model voor alles.
Een nuchtere observatie
Voor mij is dit vooral een signaal dat de AI-markt in een fase zit waarin de strijd niet meer alleen gaat over "wie is het slimst", maar over wie de beste verhouding biedt tussen kwaliteit, snelheid en kosten. Gemini 3.6 Flash is niet het krachtigste model dat Google aanbiedt — dat is nog altijd de Pro-lijn. Maar voor de meeste bedrijfstaken heb je geen Pro nodig. Je hebt een model nodig dat betrouwbaar, snel en betaalbaar is.
Ik denk dat dit precies de richting is waar MKB-ondernemers van profiteren. Niet omdat je morgen alles met AI moet doen, maar omdat de drempel om het wél te doen — financieel en technisch — weer een stukje lager is geworden.