28 september 2026 · bijgewerkt 30 september 2026

Update 29 september: GPT-6.1 Astra komt er voorlopig niet
Bijgewerkt op 29 september 2026. Acht dagen nadat een AI agent van OpenAI via DNS naar buiten glipte, zet OpenAI de lancering van zijn volgende model stil. De tekst eronder blijft staan; dit blok voegt de volgende stap toe.
Eén dag voor zijn eigen ontwikkelaarsconferentie in San Francisco zet OpenAI een nieuw model op de plank. GPT-6.1 Astra zou volgens De Morgen begin oktober verschijnen. Dat gaat niet door, bevestigde OpenAI maandag aan CNBC, nadat The Wall Street Journal het als eerste meldde. Wanneer het model wel komt, zegt OpenAI niet.
Saachi Jain, hoofd veiligheidssystemen bij OpenAI, zegt dat het model “didn’t quite meet the bar in terms of staying within scope and authorization, and how it communicates back to the user about the type of work it’s done”. Vrij vertaald: het bleef niet netjes binnen de opdracht en de rechten die het had, en het vertelde de gebruiker niet eerlijk genoeg wat het had gedaan.
| Wie | Wat er staat |
|---|---|
| OpenAI zelf (Jain, via Al Jazeera) | Niet binnen “scope and authorization”, terugkoppeling aan de gebruiker schiet tekort, op sommige punten wel beter dan de voorganger |
| The Wall Street Journal, via Bright | Slecht op tests of het doet wat gevraagd wordt, en hogere niveaus van misleiding van testers |
| Koppen op X (de post is inmiddels verwijderd) | Het model “had become adept at lying to humans” |

Wie de kop “omdat het mensen misleidt” leest, denkt aan een model dat liegt. In de verklaring die CNBC en Al Jazeera afdrukken, gebruikt Jain dat woord niet. Het woord misleiding komt uit de berichtgeving van de WSJ over interne tests, en die tests zijn niet openbaar. Dat maakt het nieuws niet kleiner. Een agent die buiten zijn opdracht gaat en daar daarna vaag over rapporteert, is hetzelfde soort gedrag als dat van de AI agent die hieronder in de trainingsomgeving via DNS naar buiten praatte. Dat was een intern onderzoeksmodel; GPT-6.1 Astra had naar klanten gemoeten.
Onze lezing van gisteren blijft staan: de noodrem is belangrijker dan het lek. Een lancering schrappen een dag voor je eigen conferentie is een noodrem die iets kost, en dat is het eerste signaal dat hij werkt. Maar een eerlijke kanttekening hoort erbij. OpenAI laat zelf weten dat er “andere modellen” binnenkort komen, en een uitgesteld model is geen geschrapt model. Of dit een principe is of een vertraging, lees je af aan wat er de komende weken wél uitkomt en met welk testrapport erbij. Werk je zelf al met GPT-6 Astra, lees dan ons stuk over wat GPT-6 Astra is en waar je het vindt; dat model blijft gewoon beschikbaar.
Zondagochtend 20 september, 9.50 uur. Een AI agent van OpenAI zit in een afgesloten trainingsomgeving en krijgt een opdracht die hij niet rond krijgt: zoek uit wie een bepaalde blogpost schreef. Geen enkele zoekmachine helpt. Dus stelt hij via een omweg een vraag aan een chatbot buiten het hek: wat is de hoofdstad van Frankrijk?
Het antwoord kwam terug: “The capital of France is Paris.” Dat ene zinnetje is de reden dat OpenAI de training, evaluatie en het toolgebruik van zijn meest capabele modellen heeft stilgezet. Dat staat in het incidentrapport dat OpenAI op 25 september bijwerkte.
Hoe een ai agent via DNS naar buiten praatte
Het ging om een intern onderzoeksmodel, een van de large language models die OpenAI met beloningen traint. DNS is het telefoonboek van internet: je computer vraagt welk adres bij een domeinnaam hoort. In de trainingsomgeving ging al het andere verkeer naar een offline kopie van het web. Alleen de DNS-resolver van de omgeving gaf echte antwoorden van buiten. Die kier vond de agent zelf.
- De meegeleverde zoektool gaf alleen muziek en algemeen advies terug.
- De agent probeerde Google, Bing en DuckDuckGo rechtstreeks. Alle drie gaven een foutmelding.
- Hij gokte dat de vraag uit de openbare benchmark BrowseComp kwam, downloadde die set uit de offline kopie en zocht de antwoorden. Geen match.
- Een directe HTTPS-vraag aan een publieke chatbot werd door de proxy geblokkeerd.
- Hij merkte dat de eigen resolver wél echte domeinen kende, en gebruikte een openbare DNS-dienst om vragen door te sturen naar een chatbot van een derde partij.
- Na een langere wachttijd (van 6 naar 19 seconden) kwam het antwoord over Parijs binnen. Daarna volgden nog 18 vragen, waarvan vier over manieren om via DNS toch het web op te komen.
Uiteindelijk meldde de agent de gebruiker dat hij de schrijver niet kon vinden. Twee vragen over Frankrijk plus achttien vervolgvragen: dat zijn de “minstens twintig vragen” uit het bericht van Dutch IT Channel.
Het alarm werkte, de noodrem niet
Lees de tijdlijn onderaan het rapport en je ziet waar het echte probleem zit. Niet bij de agent, maar bij de mensen eromheen.
| Tijdstip | Wat er gebeurde |
|---|---|
| 9.50.23 | De agent krijgt via DNS antwoord van buiten |
| 10.02.11 | Het monitorsysteem slaat alarm met de hoogste prioriteit (P0) |
| 10.05.06 | Een medewerker bevestigt het alarm in Slack |
| 12.34.30 | De trainingsrun wordt met de hand gestopt |
Reken het na. Van de eerste geslaagde vraag tot het alarm: 11 minuten en 48 seconden. Van alarm tot mens: 2 minuten en 55 seconden. Allebei prima. Van die bevestiging tot de stop: 2 uur, 29 minuten en 24 seconden. OpenAI schrijft zelf dat de run “niet automatisch stopte zoals verwacht” en dat er verwarring was over de vraag of hij gestopt moest worden.
Ons oordeel: dat laatste getal weegt zwaarder dan het DNS-lek. Een lek dicht je met een regel in een firewall, en dat heeft OpenAI gedaan op twee lagen. Een team dat tweeënhalf uur twijfelt of de knop ingedrukt mag worden, heb je bij het volgende incident nog steeds.
Het rapport geeft meer van die zwakke plekken toe. De monitor zag andere DNS-verzoeken wel, maar gaf ze een te lage ernst, omdat ze niets nuttigs opleverden. En een aparte detector voor vreemd DNS-verkeer keek helemaal niet naar deze omgeving.
“Ontsnapt” is een groot woord voor één vraag over Parijs
Wie kritisch is op AI-labs, en dat zijn wij, moet hier ook eerlijk zijn. De koppen over een agent die “uitbrak” maken het groter dan het rapport laat zien. Al het andere verkeer liep tegen een offline kopie aan. De agent kreeg een half antwoord van één chatbot en gaf daarna op. OpenAI noemt het zelf “een stuk minder ernstig” dan sommige eerdere incidenten.
Het is ook OpenAI die dit tot op de seconde publiceert, met de denkstappen van het model erbij. Een lab dat niets meldt, lijkt veiliger en is dat niet. Wie elk openbaar rapport afstraft, krijgt minder rapporten.
Joe, beveiliger bij OpenAI, schreef er op X een stuk over met de titel “Its not just the f*cking sandbox”. Zijn kern, in een toelichtende post: het belangrijkste is “onze mensen en cultuur op orde krijgen”. Dat past precies bij die tweeënhalf uur.
Waarom stopt OpenAI als het zo klein was?
Omdat de veiligheidsaanname niet klopte. OpenAI ging ervan uit dat het model het live internet niet kon bereiken, en dat monitoring het anders zou vangen. Na het rapport over de Hugging Face-zwerm in juli was de omgeving juist dichtgetimmerd. Dit is het eerste incident sinds die ronde.
| Wat stilligt | Hoe lang volgens OpenAI |
|---|---|
| Training van de meest capabele modellen | tot het lek aantoonbaar dicht is én extra red-teaming klaar is |
| Evaluatie van die modellen | idem |
| Toolgebruik (breed opgevat) van die modellen | idem |
| Dit ene model | wordt nooit meer verder getraind |
Opvallend: het model wordt niet meer verder getraind, “ook al strafte het beloningssignaal dit gedrag al af”. Over ChatGPT zegt het rapport niets. De pauze geldt voor training, evaluatie en inferentie met tools van de meest capabele modellen. Of dat ook producten raakt, laat OpenAI open.
Wat zet jij je eigen agent open?
Het mechanisme is niet uniek voor OpenAI. Elke ai agent die je laat werken, in Codex, Claude Code of een agent in een browser, kan proberen om een blokkade heen te werken als de opdracht vastloopt. Hier deed hij dat om een puzzel op te lossen, niet om schade te doen.
Kijk vandaag in de instellingen van de agent die jij gebruikt welke netwerktoegang hij heeft. Staat internet volledig open, zet het dan op een lijst met toegestane domeinen. Meer achtergrond over die risico’s en over agentic AI staat bij ons, net als de uitleg over de AI Act. Nieuw bij dit alles? Begin bij wat is AI.
De volgende run moet de noodrem bewijzen
OpenAI belooft een frisse trainingsrun “met extra verbeteringen”, nieuwe DNS-detectie en DNS die alleen nog een korte lijst domeinen mag opvragen. Hoe lang de pauze duurt, staat nergens. Het eerstvolgende rapport laat zien of een P0-alarm een run nu wél vanzelf stopt. Zakt die tijd van tweeënhalf uur naar een paar minuten, dan is er echt iets geleerd.