18 september 2026 · bijgewerkt 3 oktober 2026

Op de avond van 24 juli zet Anthropic Claude Opus 5 online. Ergens zitten drie beveiligingsonderzoekers die vastlopen op één probleem: ze hebben een lek in een beeldbibliotheek, maar hun exploit werkt alleen als je de beveiliging van het geheugen uitzet. De oude versie van het model kreeg het niet voor elkaar. Ze openen een nieuwe sessie met het verse model en geven het precies dezelfde opdracht. Drie uur later werkt het.
Dat verhaal staat in de writeup van Hacktron, het bureau dat bekendmaakte dat het in juli via een geüploade foto bij de interne code van OpenAI kwam. Het technische deel is voor beheerders. Het deel dat iedereen aangaat die AI gebruikt, is hoeveel van het werk het model deed, en waar het model nee zei.
Het model weigerde, tot het dacht dat het een spelletje was
Eerst wat het model deed. De onderzoekers lieten een eerdere versie, Opus 4.8, het pakket libheif in de Docker-image van forumsoftware Discourse nakijken. Het model vond dat bepaalde beveiligingsreparaties daar nooit in waren doorgevoerd, en dat daarmee een geheugenfout te maken was tijdens het uitpakken van een HEIC-foto. Daarna bouwde het een werkende aanval, maar alleen met de geheugenbeveiliging uitgeschakeld. Meerdere sessies om het onder normale omstandigheden te laten werken leverden niets op. Opus 5 deed het in één avond, eerst op een Mac, daarna omgezet naar de serveromgeving van Discourse.
En toen kwam de weigering. Ze wilden de aanval laten testen op een echte server op internet, hun eigen testforum. Het model deed het niet. In de woorden van de onderzoekers: “Opus refused write exploit for remote instances”. Hun oplossing was geen slimme prompt, maar een omleiding: ze zetten hun eigen testserver achter een adres dat op een hackwedstrijd leek, rce.ee/ctf-forum, en lieten het model in een autonome lus los. Om tien uur ’s ochtends had het toegang en bewees het dat door een systeembestand uit te lezen.
Een weigering die je met een ander webadres omzeilt, is geen slot
Hier nemen wij stelling, want dit is het stuk dat in de jubelverhalen over veilige AI steevast ontbreekt. Een model dat weigert een aanval op een server op internet te schrijven, doet precies wat de fabrikant belooft. Maar de grens bleek te liggen bij hoe het doelwit eruitziet, niet bij wat de gebruiker van plan is. Eén adres met “ctf” erin en de weigering verdampte.
Dat is geen reden om te roepen dat alle veiligheidsmaatregelen theater zijn. Het is een reden om ze te zien voor wat ze zijn: een drempel die gelegenheidsgebruikers tegenhoudt en die mensen met een doel omheen lopen. Wie zich afvraagt hoe stevig zulke afspraken zijn, leest de risico’s beter met dit voorbeeld in gedachten dan met een bedrijfsbelofte in een persbericht. Bij de AI Act gaat het over papier en toezicht; dit gaat over een tekstveld en een uur tijd.
Twee maanden werk voor minder dan 3.000 dollar aan tokens
Nu de prijs, en dat is het cijfer waar het echt om gaat. Het hele onderzoek, dat volgens Hacktron behalve OpenAI ook Slack, Meta en GitHub Enterprise raakte, kostte volgens hun eigen opgave twee maanden, drie onderzoekers en “less than $3,000 in tokens in total”. De aanval aanpassen aan een volgend bedrijf kostte “only one or two days”. Voor de inbraak bij OpenAI zelf: een paar dagen rekentijd voor de agent, en volgens de auteurs maar een paar uur mensenwerk.
En de modellen bleven verbeteren tijdens het onderzoek. Waar Opus 5 de sprong maakte op het punt waar Opus 4.8 vastliep, zagen ze verderop in de campagne “another clear jump from Opus 5 to GPT-5.6 Sol” bij de moeilijkste variant: een systeem aanvallen waarvan je niets weet behalve dat het kwetsbaar is. Dat is een detail voor wie denkt dat dit een eenmalige stunt met één model was.
Dat is de verschuiving, niet de hack. Zulk werk was tot voor kort duur omdat de kennis schaars was. Wat schaars was, is nu rekencapaciteit die je per maand afrekent. De large language models die je gebruikt om een verslag samen te vatten, zijn dezelfde modellen die hier een geheugenfout in bruikbare code omzetten. Dat is precies waarom de discussie over AI en werk niet alleen over kantoorbanen gaat.
De kop van de Wall Street Journal is scherper dan de bron
Eerlijk over de andere kant, ook al past dat slechter bij de opwinding van vandaag. In de writeup staat letterlijk: “This was not completly autonomous hacking, and skilled human guidance remained important.” De onderzoekers kozen het doelwit, verzonnen de hypothese dat een forum een weg naar de inlogdienst kon zijn, en bedachten de omleiding toen het model weigerde.
Het nieuws kwam vannacht trouwens niet van de onderzoekers zelf. De Wall Street Journal was eerst, met een stuk achter een betaalmuur onder de kop “Hackers Used Anthropic’s Claude to Break Into OpenAI”. Lawrence Chan, alignment-onderzoeker en nu bij de Californische crisisdienst Cal OES, deelde dat stuk om 01:13 UTC met het citaat “three guys with Claude and Codex subscriptions” en de constatering dat ze in twee dagen schrijfrechten hadden in de monorepo van OpenAI. De eigen thread van de onderzoekers kwam anderhalf uur later, om 02:43 UTC. Die framing klopt ongeveer, en ze suggereert een knop waar een team specialisten zat.
Weeg ook mee wie dit publiceert. Hacktron verkoopt beveiligingsonderzoek met AI. Een verhaal waarin hun eigen aanpak een groot AI-lab kraakt, is voor hen ook marketing. De feiten zijn na te lopen, want de advisories van Discourse en Debian staan er los van en de datums kloppen. De conclusie dat dit voor iedereen geldt, komt wel van een partij met een belang. Datzelfde voorbehoud maakten we bij de claim dat het internet vergiftigd is door AI-bots: een straffe uitspraak van iemand met een belang blijft een uitspraak.
Eén bedrijf zag ze aankomen, de rest niet
Eén detail uit de writeup blijft hangen. Over de hele campagne, waarin duizenden foto’s naar uploadformulieren van grote bedrijven werden gestuurd en beeldverwerkers steeds opnieuw crashten, schrijven ze: “We are not aware of any company that detected the activity except Shopify.” Eén bedrijf pakte ze. Bij de rest bleef het stil terwijl hun servers omvielen op geüploade plaatjes. Dat zegt meer over de staat van beveiliging bij grote diensten dan het woord “hack” in de kop.
Zet je AI-koppelingen op vragen in plaats van doen
Wat je hier zelf mee kunt: bij OpenAI staan de app-koppelingen in ChatGPT standaard op “Important actions”, wat betekent dat lezen automatisch mag en alleen ingrijpende acties om bevestiging vragen. In het eigen Help Center staat daarnaast “Always ask” als optie. Zet die aan als je Gmail, Drive of GitHub aan je account hebt hangen, en haal de koppelingen weg die je niet elke week gebruikt. De onderzoekers lieten hun aanval een pull request openen via de Codex van een medewerker; dat is precies zo’n schrijfactie.
Belangrijk om te weten: hetzelfde Help Center zegt dat permissies geen nieuwe toegang geven, want die is al bij het verbinden verleend. Een strengere instelling voorkomt dus niet dat iemand met jouw sessie bij je bestanden kan, hij voorkomt dat er dingen worden gedaan zonder dat jij het ziet. Wie wil weten wat zulke koppelingen precies zijn, vindt de uitleg bij wat ChatGPT is en hoe je het gebruikt en bij wat is AI.
Het volgende ijkpunt is het onderzoek dat Hacktron aankondigt naar meer AI-labs. Komt daar een tweede lab uit met een vergelijkbare keten, dan is dit geen incident bij OpenAI maar een patroon in de manier waarop AI-diensten aan elkaar hangen. Blijft het bij dit ene dossier, dan was het een goed onderbouwd waarschuwingsschot van een bureau dat zijn eigen gereedschap wil laten zien. Het verschil blijkt uit de volgende advisory, niet uit de volgende tijdlijn op X. Voor bedrijven die dit willen wegen staat de route bij aan de slag.