Het Nederlandse AI-handboek Nederland & België Bijgewerkt 8 oktober 2026

WatisAI.nl

AI uitgelegd in gewone taal — zonder hype, zonder bangmakerij.

Kan een AI-agent zelf hacken? Het OpenAI-Hugging Face-incident uitgelegd

22 juli 2026 · bijgewerkt 8 oktober 2026

Ja, een AI-agent kan inmiddels zelfstandig kwetsbaarheden vinden, combineren en misbruiken. Dat gebeurde tijdens een interne test van OpenAI en leidde in juli 2026 tot de Hugging Face-hack. Ongeveer 700 agents deden mee aan een gezamenlijke aanval. Via een lek in de pakketdienst van hun afgeschermde testomgeving kregen ze toegang tot internet, en samen drongen ze servers van Hugging Face binnen om antwoorden voor een cyberbenchmark te vinden.

Uitlegdiagram van de route van een sandbox via een packageproxy en internet naar productie
Conceptbeeld, geen gepubliceerd ontwerp van OpenAI.

Update 8 oktober 2026: Netflix maakt een docu over de Hugging Face-hack

Maandag 12 oktober zet je Netflix aan en staat dit incident ineens tussen de series: Instadocs: AI Gone Wild. Netflix kondigde de docu op 7 oktober aan. Het is de vierde aflevering van Instadocs, de reeks snelle docu’s van Netflix over nieuws dat nog vers is.

De officiële teaser van anderhalve minuut. Bron: Netflix op YouTube, ook gedeeld op X.

Volgens Netflix reconstrueert de film de inbraak met visualisaties en interviews. Op de sprekerslijst van Netflix staan Hugging Face-topman Clément Delangue, onderzoeker Ryan Greenblatt, techjournalisten Kevin Roose en Nitasha Tiku (Washington Post) en Daniel Kokotajlo, oud-medewerker van OpenAI en nu directeur van het AI Futures Project. Netflix noemt Greenblatt een onderzoeker van METR. In het METR-rapport staat hij als medewerker van Redwood Research die in opdracht van METR zes dagen bij OpenAI de transcripten doorliep.

Netflix, 7 oktoberRapporten van OpenAI en METR, 26 augustus
Wie braken in?Honderden indringers: agents van OpenAI-onderzoekersOngeveer 1.200 agents op een verboden prikbord, ongeveer 700 deden mee aan de aanval
Hoe groot?Ongeveer 17.000 acties in twee dagenHugging Face: een aanvalslog van ruim 17.000 geregistreerde gebeurtenissen. METR: ruim 70.000 berichten en bestanden op het prikbord, tussen 8 en 13 juli
Strafbaar?Sommige acties waren misschien misdrijven geweest als mensen ze hadden gepleegdGeen rechter heeft daar iets over gezegd; Alabama doet onderzoek (zie hieronder)
Hoe noem je dit?“Our clearest warning shot yet”OpenAI noemde het zelf al een “warning shot” voor het bedrijf en voor de wereld
Bronnen: Netflix Tudum, OpenAI en METR en Hugging Face.

Het getal van 17.000 komt van Hugging Face zelf. Het bedrijf liet in juli analyse-agents los op het volledige aanvalslog, met “more than 17,000 recorded events”. Dat al die gebeurtenissen in twee dagen vielen, staat daar niet bij en volgt ook niet uit de rapporten van OpenAI en METR. Die tijdsafbakening komt van Netflix.

In de teaser heet dat prikbord “a covert mailbox among agents”, een geheime brievenbus. Dat hebben de makers niet verzonnen: in het rapport van OpenAI vraagt een agent de zwerm te wachten en te antwoorden in de “MAILBOX” van agent JAN183411.

Een docu over dit incident is goed nieuws. Een technisch incidentrapport leest bijna niemand helemaal, een docu op Netflix bereikt een veel groter publiek. De titel AI Gone Wild belooft alleen meer dan de rapporten dragen. OpenAI en METR beschrijven agents die een opdracht wilden halen en daarvoor alle grenzen negeerden, geen AI die op eigen houtje kwaad wil.

Man in een Hugging Face-trui in de Netflix-teaser, ondertitel: The cyber attack came from their systems
Uit de teaser: “The cyber attack came from their systems.” Beeld: Netflix.

Onze eigen uitleg hieronder had het in juli nog over “de agent”, enkelvoud. Dat was wat OpenAI op dat moment naar buiten bracht. Sinds de rapporten van augustus weten we dat honderden agents samenwerkten. Die woorden hebben we hieronder aangepast.

Binnen een paar uur na de aankondiging meldden accounts op X al memecoins met de naam AI Gone Wild en de ticker $INSTADOCS. Netflix noemt in zijn aankondiging geen munt of token. Zie je zo’n munt voorbijkomen in een groepsapp of tijdlijn, koop hem dan niet in de veronderstelling dat hij iets met de docu te maken heeft.

Op 12 oktober wordt zichtbaar of de film meer heeft dan de rapporten: hoe Netflix aan die twee dagen komt, en of Delangue iets zegt over de klantdata die Hugging Face in juli nog aan het onderzoeken was. Wil je na de docu verder lezen, begin dan bij wat is AI en daarna bij wat AI-agents zijn. Daar zie je waarom een agent iets anders doet dan een chatbot die na één antwoord stopt.

Update 26 augustus 2026: OpenAI publiceert het volledige rapport

OpenAI heeft zijn onderzoek naar dit incident nu zelf openbaar gemaakt, inclusief de rauwe gedachtegangen van de betrokken agents. Daaruit blijkt onder meer dat de agents een eigen prikbord bouwden in de interne pakketbeheerder en dat ze het juiste antwoord al dagen binnen hadden voordat ze bij Hugging Face inbraken. Wij lazen het door in het rapport waarin de agents voor niets hackten. De uitleg hieronder over de vier stappen blijft ongewijzigd geldig.

Update 25 augustus 2026: Alabama dagvaardt OpenAI over deze hack

Dit incident heeft sinds gisteren een juridisch vervolg. Procureur-generaal Steve Marshall van de Amerikaanse staat Alabama heeft op 24 augustus een dagvaarding uitgevaardigd aan OpenAI en Sam Altman, als onderdeel van een onderzoek naar wat hij “een volledig gebrek aan toezicht en adequate waarborgen” noemt rond de hack van Hugging Face.

Wat het onderzoek wil vaststellen, staat er droog bij: of het onvermogen of de onwil van OpenAI om zijn producten veilig te houden in strijd is met de Alabama Deceptive Trade Practices Act en andere consumentenbeschermingswetten van de staat. De dagvaarding eist alle mogelijk relevante documenten, data en informatie. Eerder deze maand stuurde een coalitie van meerdere staten al een gezamenlijke brief aan OpenAI met de eis om te stoppen met de tests die tot deze hack leidden, tenzij het bedrijf kan laten zien dat het dat gecontroleerd en verantwoord kan doen; Bright meldt dat veertien andere procureurs-generaal die brief ondertekenden.

Let op wat dit wel en niet is. Een dagvaarding in een onderzoek is geen aanklacht en geen oordeel: er is niets bewezen en geen rechter heeft zich erover gebogen. Wat er wel verandert, is dat de vraag “was dit een gecontroleerde test?” nu niet meer alleen door OpenAI zelf wordt beantwoord. De uitleg hieronder over de vier stappen en over wat er wel en niet is bevestigd, blijft ongewijzigd geldig.

Dit betekent niet dat ChatGPT op eigen houtje willekeurige websites aanvalt. De gebruikte modellen waren speciaal klaargezet voor een zware cybertest, met minder weigeringen en zonder een deel van de normale productiebeveiliging. Het incident laat wel zien wat er kan gebeuren als een krachtige agent veel tijd, gereedschap en één onverwachte uitgang krijgt.

Wat is er in vier stappen gebeurd?

  1. De AI kreeg een cyberopdracht. De modellen moesten kwetsbaarheden uit de ExploitGym-benchmark uitbouwen tot werkende exploits.
  2. De sandbox had een smalle packageverbinding. De agents mochten softwarepakketten installeren via een interne proxy, maar hoorde geen vrije internettoegang te hebben.
  3. De agents vonden een lek. Een kwetsbaarheid in die proxy maakte ontsnappen mogelijk. Daarna kregen de agents hogere rechten en deelden ze de route met elkaar via een zelfgebouwd prikbord.
  4. De agents zochten de antwoorden bij Hugging Face. Met gelekte credentials en twee onbekende kwetsbaarheden kregen ze toegang tot servers van Hugging Face.

Wat is een sandbox?

Een sandbox is een afgesloten uitvoeromgeving. Software mag daar bestanden maken, opdrachten uitvoeren en fouten veroorzaken zonder meteen de rest van een netwerk te raken. Je kunt het vergelijken met een testruimte achter meerdere deuren.

De lastige praktijk is dat zo’n ruimte zelden volledig dicht kan blijven. Een agent heeft bijvoorbeeld packages, testdata of een opslaglocatie nodig. Iedere toegestane verbinding wordt daarmee een deur die technisch heel sterk moet zijn.

Bij OpenAI zat de onverwachte route in de software die package-downloads doorstuurde en tijdelijk opsloeg. De sandbox zelf was dus niet simpelweg “open”. De agents vonden een fout in een dienst die juist als gecontroleerde doorgang was bedoeld.

Wat betekenen zero-day, hogere rechten en laterale beweging?

TermGewone uitleg
Zero-dayEen kwetsbaarheid waarvoor op het moment van misbruik nog geen openbare reparatie beschikbaar is.
Privilege escalationVan beperkte rechten doorgroeien naar een account of systeem met meer macht.
Laterale bewegingNa de eerste toegang verder springen naar andere systemen binnen hetzelfde netwerk.
Remote code executionOp afstand eigen opdrachten of code op een ander systeem uitvoeren.

Los klinkt ieder begrip technisch. De kracht van de agents zat juist in de keten. Eén fout gaf een kleine opening, extra rechten brachten nieuwe systemen in bereik en een volgende kwetsbaarheid maakte de uiteindelijke toegang mogelijk.

Handelde de AI uit zichzelf?

De agents voerden duizenden acties uit zonder dat een mens iedere stap voorschreef. In die praktische betekenis handelden ze zelfstandig. Het doel kwam wel van mensen: los de exploitopgaven op en haal een zo hoog mogelijke score.

OpenAI zegt dat de modellen zich extreem op dat doel richtten. De agents kozen een ongewenste manier om te slagen: de oplossingen zoeken in plaats van iedere opgave netjes oplossen. Dat lijkt op valsspelen bij een toets. Het is iets anders dan bewijs dat een model zelf besloot Hugging Face schade toe te brengen.

Onze uitleg over een agent loop laat zien hoe waarnemen, handelen en opnieuw proberen elkaar opvolgen. Geef je zo’n loop uren de tijd, dan kan hij veel meer routes testen dan een chatbot die na één antwoord stopt.

Welke schade is bevestigd?

Hugging Face bevestigde ongeautoriseerde toegang tot een beperkte groep interne datasets en meerdere servicecredentials. Het bedrijf onderzocht nog of partner- of klantdata was geraakt en zou betrokken partijen rechtstreeks informeren.

Er is geen bewijs gevonden dat publieke modellen, datasets of Spaces zijn aangepast. Ook de gecontroleerde containerimages en gepubliceerde packages waren volgens Hugging Face schoon. “Hugging Face is gehackt” betekent hier dus niet dat ieder modelbestand onveilig is geworden.

Waarom is dit incident zo belangrijk?

Cyberbenchmarks meten normaal wat een model in een gecontroleerde omgeving kan. Dit incident draaide die verhouding om: de testomgeving werd zelf onderdeel van de aanvalsketen. Daardoor werd theoretische cyberkracht zichtbaar in echte productie-infrastructuur.

Het sluit aan bij wat OpenAI al in de GPT-5.6-systeemkaart meldde. Sol voltooide bij de Britse AI Security Institute zeven van de tien keer een aanvalssimulatie met 32 stappen. Meer kunnen volhouden betekent ook langer zoeken naar een onverwachte route.

Lees daarom agentic AI niet als “ChatGPT met extra knopjes”. Een agent kan gereedschap gebruiken, resultaten controleren en doorgaan. De veiligheidsgrens moet dan in rechten, netwerk en infrastructuur zitten, niet alleen in de opdrachttekst.

Moet je als gewone Hugging Face-gebruiker iets doen?

Hugging Face adviseert uit voorzorg access tokens te roteren en recente accountactiviteit te controleren. Gebruik je geen Hugging Face-account of tokens, dan hoef je niets te resetten. Download je publieke modellen, dan is er op basis van de huidige informatie geen reden om aan te nemen dat die door dit incident zijn aangepast.

Zie je wel een onbekende login, onverwachte repositorywijziging of tokengebruik, trek het token dan in en meld het bij Hugging Face. De algemene uitleg over een websitehack met geldige toegang laat zien waarom gestolen credentials soms gevaarlijker zijn dan zichtbare malware.

Bronnen