19 september 2026
Ergens in San Francisco speelt een computer Doom. Niet met een bot die het spel van binnenuit kent, maar met een AI-model dat tien keer per seconde de vraag krijgt: wat zie je, en wat doe je nu. De engineer die het bouwde durfde het bijna niet te vertellen, want tien vragen per seconde kost ongeveer zeven dollar per uur. Zijn collega’s vonden dat juist goedkoop.
Die demo staat in de aankondiging van TypeSafe AI van 15 september. Het bedrijf is van Diogo Almeida, die bij OpenAI meewerkte aan het onderzoek achter ChatGPT en daarna twee jaar in stilte aan iets anders bouwde. Zijn model heet Jev. Het kan geen zin schrijven, en dat is geen beperking die ze er nog uit gaan halen. Dat is het hele idee.
Wat komt eruit als er geen tekst uit komt?
Elke chatbot die je kent doet hetzelfde trucje: woord voor woord raden wat er volgt. Handig als je een mail wilt laten schrijven, lastig als je software erop wilt bouwen, want je moet de uitkomst weer uit de tekst peuteren en hopen dat het formaat klopt.
Jev doet het omgekeerd. Je geeft het model een stuk toestand (een mail, een regel uit een logbestand, een supportticket, de coördinaten uit een spel) en een lijstje vragen met vooraf vastgelegde antwoordopties. Terug komt geen tekst maar een keuze, een score of een ja/nee, met een kans erbij. Meerdere vragen tegelijk, in één keer berekend in plaats van woord voor woord. TypeSafe noemt dat een System One-model, naar het snelle, intuïtieve denken uit het boek van Daniel Kahneman. Het is nadrukkelijk geen chatmodel, en dus ook geen concurrent van de large language models die je kent.
De naam komt van William Stanley Jevons, de econoom die in de negentiende eeuw zag dat zuiniger stoommachines niet minder maar méér kolen verbruikten. TypeSafe verwacht hetzelfde met intelligentie: elke keer dat het tien keer goedkoper wordt, gaan mensen het tien keer vaker gebruiken.
Veertig dollarcent per duizend beslissingen
De cijfers uit de eigen aankondiging, zodat je ze naast je eigen rekening kunt leggen. Invoer kost 0,042 dollar per miljoen tokens, uitvoer is gratis (“too cheap to meter”). Een chatmodel rekent 0,20 tot 10 dollar per miljoen invoertokens, en uitvoer is daar meestal vijf keer zo duur als invoer. Een antwoord is er volgens TypeSafe in 70 tot 500 milliseconden, tegen 3 tot 329 seconden bij de grote modellen.
Op hun eigen testpagina staan vier werkstromen uitgewerkt: beveiligingsmeldingen, het nakijken van een agent-log, facturen verwerken en klantenservice. Elk model krijgt dezelfde opzet. Jev komt uit op 67,8 procent goede antwoorden, 0,0004 dollar per zaak en 0,4 seconde. Het duurste model in de test haalt 73,1 procent voor 0,1761 dollar en 37,8 seconden per zaak.
| Model (zelfde werkstroom) | Goed | Kosten per zaak | Tijd per zaak |
|---|---|---|---|
| Jev | 67,8% | $0,0004 | 0,4 s |
| Sonnet 5 | 67,8% | $0,1174 | 78,1 s |
| Opus 5 | 73,1% | $0,1761 | 37,8 s |
| Sol | 74,1% | $0,0836 | 23,3 s |
Daar zit het nieuws, en meteen de nuance. Jev is niet slimmer. Sonnet 5 haalt in dezelfde test exact dezelfde 67,8 procent, en de twee beste modellen liggen er vijf tot zes punten boven. Wat verandert, is de prijs per beslissing en de tijd. Tegen dat even goede model is Jev bijna 300 keer goedkoper (0,0004 tegen 0,1174 dollar) en bijna 200 keer sneller (0,4 tegen 78,1 seconden). Dat maakt dingen mogelijk die je eerder niet eens probeerde. Zoals tien keer per seconde iets vragen aan een AI.
“Kan niet hallucineren” betekent iets anders dan je denkt
In de aankondiging staat dat Jev “can’t hallucinate”. Die zin gaat mensen op het verkeerde been zetten.
Wat er waar aan is: als jij de opties A, B en C vastlegt, krijg je A, B of C terug. Nooit D, nooit een half afgemaakte JSON, nooit een verzonnen functienaam. Dat is een echte garantie en voor programmeurs een verademing. Wat er niet waar aan is: dat het antwoord klopt. Het model kan gewoon B kiezen waar A het goede antwoord was, en dat met hoge zekerheid doen. 67,8 procent goed betekent ook 32 procent fout.
Een ontwikkelaar, Jace Hall, schreef het een paar uur na de json-render-demo zo op: “Constrained output isn’t a new category of correctness. It’s a parser you don’t have to write.” Die post stond bij het schrijven op 45 weergaven, tegenover ruim 437.000 voor het filmpje dat de opwinding veroorzaakte. Dat is precies het probleem: de claim reist, de nuance niet. Hij wijst er ook op dat het publiek hallucinaties, ontsporende agents en AI-veiligheid als één ding ziet, en dat “never hallucinates” dan leest als een opgelost probleem. Dat is het niet. Wat er is opgelost, is dat je geen D terugkrijgt.
TypeSafe is eerlijker over zijn eigen test dan wij verwachtten
En nu het ongemakkelijke deel voor iedereen die dit weg wil zetten als marketing, wijzelf inbegrepen. Wie de testpagina echt leest, ziet dat het bedrijf zijn eigen zwakke plekken opschrijft. De goede antwoorden zijn geen vastgestelde waarheid maar het gemiddelde van twee dure modellen van OpenAI en Anthropic, en TypeSafe schrijft er zelf bij dat dat hun scores bevoordeelt. Bij het hallucinatiecijfer staat: “Our number is not empirical.” De prijzen van de andere modellen komen van OpenRouter, en ook daar schrijven ze zelf bij dat er bijna zeker vertekening in zit omdat ingewikkelder vragen naar duurdere modellen worden gestuurd. Dat raakt precies de dollarbedragen in de tabel hierboven. De snelheidsmetingen komen van laptops aan de westkust. De Doom-demo draait op een uitgeschreven spelsituatie, niet op beeld.
Dat is meer openheid dan de meeste modelkaarten bieden. De 193 keer sneller en 444 keer goedkoper op hun eigen voorpagina hoef je dus niet te wantrouwen; die komen uit deze tabel en kloppen op een afronding na. De vraag die overblijft is een andere: haalt jouw soort werk ook die 68 procent, en kun jij leven met de rest.
Van de 160 vermeldingen op de fanlijst zijn er 45 geen project
Drie dagen na de aankondiging liet Chris Tate van Vercel zien wat je ermee kunt bouwen: hij koppelde Jev aan json-render, het open framework waarmee een AI een scherm samenstelt uit componenten die jij hebt goedgekeurd. Jev schrijft daar geen enkele letter. Het kiest alleen welke kaart, knop of grafiek op het scherm komt, uit een lijst die de app zelf aanlevert. Zijn filmpje stond binnen zes uur op 425.000 weergaven.
Daarnaast staat er sinds 17 september een verzamellijst op GitHub van projecten die Jev gebruiken. Die telt nu 160 vermeldingen, al zijn 45 daarvan geen project maar een draadje of een discussie. De beheerder zet er zelf een waarschuwing bij die je bij dit soort hypes zelden ziet: een vermelding is geen keurmerk, en bij meerdere repo’s die dezelfde dag van dezelfde maker komen, is volume geen bewijs van kwaliteit. Wie iets wil overnemen, kijkt dus zelf na of de code het model echt aanroept.
Zoek de plek waar jouw software nu al iets moet kiezen
Eén ding dat je deze week kunt doen, ook zonder toegang tot Jev (dat loopt nog via een wachtlijst). Pak de plek in je eigen werk waar je nu een chatmodel een simpele keuze laat maken: is deze mail spam, hoort dit ticket bij facturatie of bij techniek, klopt dit formulier. Kijk na wat die ene beslissing kost en hoe lang hij duurt. Dat is het getal waar deze nieuwe categorie modellen op mikt, en zonder dat getal kun je straks niet beoordelen of het voor jou iets uitmaakt.
En kijk meteen of je dat antwoord met een zekerheid terugkrijgt. Een model dat een taak 95 procent van de tijd goed doet maar nooit zegt wanneer het in die andere 5 procent zit, kun je niet automatiseren. Dat is de echte belofte van deze aanpak, meer nog dan de prijs. Hoe dat in de praktijk uitpakt, zie je aan generatieve AI in je eigen werkstroom eerder dan in een benchmark.
De volgende test is een kassabon, geen grafiek
Jev zit in beperkte toegang en TypeSafe haalt mensen van de wachtlijst. Het moment dat telt, komt zodra de eerste bedrijven hun echte rekening en hun echte foutpercentage publiceren, naast de eigen testpagina van de maker. Blijft de prijs dan staan en blijft de score rond de 68 procent, dan verandert er iets in hoe software beslissingen neemt. Zakt de score op jouw soort werk naar de vijftig, dan is het een snelle sorteermachine en verder niets.
Voor wie dit vakgebied volgt: dit is een ander pad dan groter en slimmer. Het gaat niet over kunstmatige intelligentie die meer kan, maar over intelligentie die zo goedkoop wordt dat je hem in een lus zet. Wat dat doet met werk, met kosten en met de vraag wie er verantwoordelijk is voor een fout van vier honderdste cent, is een discussie die nog moet beginnen. Wie de basis nog mist: op wat is AI leggen we de begrippen uit, en machine learning legt uit waarom een model überhaupt kan leren kiezen.