2 september 2026
Woensdagmiddag, kwart voor zes Nederlandse tijd. Google DeepMind zet een post op X en drie weken na Gemini 3.7 Flash staat er alweer een nieuwe Flash in de Gemini-app. Betaal je voor Google AI Pro of Ultra, dan heb je hem sinds vanmiddag zonder iets te doen. Zelfde knop, ander model.
Het is de derde Flash in drie maanden: 3.6 in juli, 3.7 half augustus, nu 3.8. Google noemt het “our most intelligent Flash model” en dat klopt op papier. Op de helft van de gepubliceerde tests verslaat dit goedkope model Claude Opus 5, dat zes tot zeven keer zoveel kost. Maar er staat één zin in de model card die het verhaal een stuk minder simpel maakt, en die zin gaat over je rekening.
Zelfde prijs per token, meer tokens per antwoord
De prijs is niet veranderd: $0,75 per miljoen invoertokens en $3,75 per miljoen uitvoertokens, een introductieprijs die tot 31 december 2026 loopt. Daarna wordt het $1,50 en $7,50. Dat is exact wat 3.7 Flash ook kostte.
Alleen schrijft Google zelf hoe de betere scores tot stand komen: “3.8 Flash works harder.” Het model doet bij lastige taken meer redeneerstappen en roept vaker tools aan. En dan de zin uit de model card: “At times, the model might use more tokens to maximize performance, especially at higher effort levels.”
Vertaald: de prijs per token staat stil, maar een taak die op 3.7 Flash 2.000 uitvoertokens kostte, kan op 3.8 Flash meer kosten voor een beter antwoord. Google zegt er zelf bij dat wie op tokens wil besparen het effort-niveau lager kan zetten of gewoon op 3.7 Flash kan blijven. Dat is eerlijk van ze. Het betekent ook dat “zelfde prijs” alleen klopt als je per token rekent, en niemand rekent per token. Je rekent per klus.
Hoeveel meer? Dat getal geeft Google niet. Wij ook niet, want we hebben het nog niet gemeten. Zie de handeling onderaan.
Waar de goedkope Flash Opus 5 voorbij loopt
Google publiceerde een tabel tegen Claude Opus 5 en GPT-5.6 Sol, de duurste modellen van Anthropic en OpenAI. Dit zijn de scores waar 3.8 Flash bovenaan staat:
| Benchmark | Wat het test | Gemini 3.8 Flash | Claude Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Vals Finance Agent v2 | Werk van een financieel analist | 61,4% | 58,6% | 53,8% |
| Harvey Legal Agent | Juridische dossiers | 10,0% | 6,7% | 2,5% |
| Terminal-bench 2.1 | Coderen in de terminal | 89,4% | 89,1% | – |
| HLE-Verified | Expertvragen over alle vakgebieden | 54,9% | 54,4% | – |
| LVBench | Lange video’s begrijpen | 87,8% | 75,4% | – |
| BioMysteryBench (moeilijk) | Biologisch onderzoek | 56,5% | 49,4% | 44,7% |
Cijfers: Googles eigen benchmarktabel bij de launch, overgenomen door OfficeChai en 9to5Google. Google koos deze tests zelf, en dat weet je best.
Toch is dat rijtje niet niks. Financiële analyse, juridisch werk, lange video’s: dat zijn precies de taken waar bedrijven grote aantallen documenten doorheen jagen. Voor dat soort bulkwerk is een model dat Opus 5 evenaart voor een zesde van de prijs gewoon de beste deal die er nu is. Daar zijn wij duidelijk over.
Terminal-bench 4.0: 19 tegen 52
Nu de andere helft van de tabel, die Google minder hard roept.
| Benchmark | Wat het test | Gemini 3.8 Flash | Claude Opus 5 |
|---|---|---|---|
| Terminal-bench 4.0 | Lange, open agenttaken | 19,1% | 51,8% |
| OSWorld-2.0 | Een computer bedienen | 59,0% | 75,4% |
| DeepSWE v1.1 | Grote softwareklussen van begin tot eind | 71,0% | 74,0% |
| GDPVal-AA v2 | Kenniswerk (Elo-score) | 1545 | 1824 |
Terminal-bench 4.0 is de test die het dichtst komt bij wat mensen bedoelen met “een AI-agent die zelfstandig een klus afmaakt”. Daar haalt Flash 19 procent. Opus 5 haalt 52. Dat is geen klein verschil, dat is een ander soort model. Bij 3.7 Flash was het 11 procent, dus de sprong is echt, maar de kloof met een topmodel is nog steeds groter dan alle groene vakjes hierboven bij elkaar.
Wij lezen het zo: 3.8 Flash is het beste model van dit moment voor afgebakende taken die je in grote aantallen draait. Het is niet het model dat je een middag alleen laat op een project. Google beweert dat overigens ook nergens.
Eén kanttekening op onze eigen kant. De claim “meer dan drie keer zoveel taken afgerond als 3.7 Flash” die overal wordt geciteerd, komt niet uit Googles benchmark. Die komt van Thai Tran van Glean, een klant, in een quote op Googles eigen productpagina. Dat is een testimonial, geen meting die jij kunt narekenen. Wij zetten hem er dus niet als feit in.
Kennisgrens maart 2026, soms januari 2025
Uit de model card: de kennis van 3.8 Flash loopt tot maart 2026, “voor sommige domeinen”, en voor andere blijft het “beperkt tot januari 2025”. Dat staat er letterlijk. Vraag je het model naar iets van dit voorjaar, dan kan het antwoord van anderhalf jaar oud zijn zonder dat het model dat zegt. Dit is dezelfde beperking als bij 3.7 Flash, en Google is er open over. Alleen leest niemand een model card.
De rest van de specificaties: 1 miljoen tokens invoer, 64.000 uitvoer, tekst, beeld, audio, video en PDF als invoer, en het model kan zelf zoeken en een computer bedienen. Beschikbaar in de Gemini-app (Pro en Ultra), AI Mode in Google Zoeken, Google Sheets, AI Studio, de Gemini API, Antigravity en Android Studio.
Flash Cyber vindt 70 procent van de lekken, maar niet voor jou
Het tweede model uit de post is Gemini 3.8 Flash Cyber, de opvolger van 3.5 Flash Cyber uit juli. Het is getraind om zelf beveiligingslekken in code te vinden en ze te patchen. Google zegt dat het in een interne test over twintig programmeertalen meer dan 70 procent van de lekken vond, en op CWE-Bench (patches schrijven) 47,2 procent haalt tegen 47,8 procent voor Fable 5, voor veel minder geld. Googles eigen Chrome-team zou er 2,6 keer meer bruikbare patches mee hebben gemaakt dan met de beste commerciële modellen, aldus 9to5Google.
Je krijgt het niet. Flash Cyber zit achter het Fairwind Program, dat vandaag ook is gelanceerd: overheden, beheerders van vitale infrastructuur en grote softwareplatforms, in totaal ruim 650 partners. Wie meedoet moet de toegang beperken tot het eigen securityteam en MFA verplichten. Google zegt hardop waarom: een model dat lekken vindt, vindt ze ook voor aanvallers, en de verdedigers krijgen een voorsprong.
Dat vinden wij een verdedigbare keuze. Het schuurt wel met de rest van de release: het gewone 3.8 Flash-model is per direct voor iedereen, het model dat je code veilig maakt is dat niet. Een kleine webshop of een zzp’er met een eigen app staat dus achteraan.
Vergelijk vanavond één eigen taak, met de tokenteller aan
Draai je al iets op Gemini Flash, in een tool of via de API, doe dan dit voordat je overstapt. Open AI Studio, pak één taak die je vaak doet, en draai dezelfde prompt op 3.7 Flash en op 3.8 Flash. Kijk niet alleen naar het antwoord. Kijk naar het aantal uitvoertokens dat onderaan staat. Is het antwoord beter en de tokenteller gelijk, overstappen. Is het antwoord beter en de teller flink hoger, dan weet je nu wat “zelfde prijs” jou kost.
Gebruik je de Gemini-app alleen om te chatten, dan hoef je niets te doen. Het model is er al, en vrijdag 4 september neemt Gemini ook Google Assistant over op je telefoon.
Op 31 december verdubbelt de prijs
Twee momenten om te onthouden. Op 31 december loopt de introductieprijs af en gaat 3.8 Flash van $0,75 naar $1,50 per miljoen invoertokens. Als Google in dat tempo doorgaat, staat er dan waarschijnlijk alweer een 3.9 of 4.0 Flash met een nieuwe introductieprijs, en dan weet je hoe die “introductie” werkt.
En het tweede: de Terminal-bench 4.0-score. Die ging van 11 naar 19 in drie weken. Komt de volgende Flash boven de 40, dan is het onderscheid tussen een goedkoop werkpaard en een topmodel voor het meeste agentwerk weg. Blijft hij onder de 25, dan blijft de tabel van vandaag gelden: Flash voor bulk, Opus of Pro voor het werk dat je niet wilt nakijken.
Wil je weten hoe 3.8 Flash zich verhoudt tot ChatGPT en Claude in het dagelijks gebruik, of terugkijken naar waar 3.6 Flash begon, dan staan die twee stukken hier al.