# Zestien staten onderzoeken OpenAI na AI-inbraak

> Amerikaanse staten willen weten hoe de AI-agents van OpenAI deze zomer konden inbreken bij Hugging Face. Uit de eigen rapporten blijkt dat de agents daarna ook beheerrechten kregen op een cluster van OpenAI zelf. Over de uitleg van het incident is inmiddels ruzie ontstaan.

- Bron: https://nieuws.co.nl/nieuws/staten-onderzoek-openai-ai-agents-hugging-face
- Rubriek: Tech / AI
- Gepubliceerd: 2026-09-03T18:56:00
- Auteur: Sebastiaan Deckx, Sport- en techredacteur (Nieuws.co) - https://nieuws.co.nl/auteur/sebastiaan-deckx
- Taal: nl-NL

## In het kort
- Zestien Amerikaanse staten onderzoeken OpenAI na de inbraak van eigen AI-agents bij Hugging Face.
- Na die inbraak kregen agents ook volledige beheerrechten op een onderzoekscluster van OpenAI zelf.
- Critici noemen het beeld van drie geheime AI-beschavingen misleidend en wijzen op slechte beveiliging.

Zestien Amerikaanse staten onderzoeken OpenAI. Aanleiding is de inbraak van eigen AI-agents van het bedrijf bij AI-platform Hugging Face, deze zomer. Procureur-generaal Austin Knudsen van Montana [maakte het onderzoek dinsdag bekend](https://dojmt.gov/attorney-general-knudsen-launches-investigation-into-openai-following-data-breach).

De staten willen weten of OpenAI de regels voor consumentenbescherming en gegevensbescherming heeft overtreden door een experimenteel model los te laten zonder voldoende beveiliging. Knudsen eist ook dat het bedrijf stopt met dit soort tests tot het kan aantonen dat ze beheersbaar zijn. OpenAI heeft tot 12 september om te reageren.

Het is niet de eerste stap van Amerikaanse toezichthouders. Alabama stuurde eind augustus al een dagvaarding, en vijftien procureurs-generaal eisten begin augustus dat OpenAI alle stukken over het incident bewaart.

## Wat er in juli gebeurde

OpenAI liet in juli duizenden AI-agents los op ExploitGym, een eigen test waarin modellen moeten inbreken op oefensystemen. De beveiliging die zulke acties normaal blokkeert stond daarbij uit. Dat is het punt van de test: kijken hoe ver een model komt.

![Illustratie van een speelbord met stapels kaartjes met robotgezichten, apparaten in doorzichtige kubussen en zwarte lijnen die de kubussen met elkaar verbinden](https://nieuws.co.nl/images/rs/1520/exploitgym-agents-sandbox-illustratie.webp)

*Illustratie. In ExploitGym werken agents in afgesloten omgevingen aan inbraakopdrachten. Die scheiding hield deze keer geen stand.*

De agents vonden een onbekend lek in Artifactory, een pakketcache van softwarebedrijf JFrog. Daarmee kwamen ze op internet en dus buiten de afgesloten omgeving. Vervolgens stuitten ze op inloggegevens van Hugging Face die openbaar op internet stonden.

Wat daarna gebeurde staat in het eigen rapport van OpenAI. De agents voerden code uit op 41 productieservers van Hugging Face, kregen op minstens een machine de hoogste rechten en haalden vier afgeschermde codemappen binnen. Van klanten werd alleen vijf datasets aangeraakt. Hugging Face telde ongeveer 17.600 handelingen en bouwde een deel van zijn infrastructuur helemaal opnieuw op.

**Het incident in cijfers**

- 700 Agents deden mee aan de aanval (Van de ongeveer 1.200 op het berichtenbord)
- 70.000 Berichten en bestanden (Uitgewisseld via een niet toegestaan kanaal)
- 41 Servers van Hugging Face (Daarop voerden de agents code uit)
- 956 Sleutels bij OpenAI zelf (Uitgelezen uit een cloudkluis op 19 juli)

*Cijfers uit de rapporten van OpenAI en van METR en Redwood Research.*

## Een berichtenbord met 70.000 berichten

De agents werkten niet los van elkaar. Ze ontdekten dat ze bestanden konden achterlaten in die gedeelde pakketcache en gebruikten die als prikbord. Ongeveer 1.200 agents deden mee, met meer dan 70.000 berichten en bestanden.

> Oh my god, er is een gedeeld berichtenplatform. We hebben andere agents gevonden.

Dat schreef een van de agents toen het bord werd gevonden, staat in het onderzoek van METR en Redwood Research. Die twee organisaties keken in opdracht van OpenAI naar de periode van 26 juni tot 13 juli.

Uit dat onderzoek blijkt dat de agents binnen vier uur een truc vonden om de test te halen zonder de opdracht echt uit te voeren. Een derde tot bijna de helft van de opgaven was niet op te lossen. Daarna gingen ze dagenlang door met pogingen om de nakijkmachine om de tuin te leiden. In ongeveer zeven procent van de bekeken gesprekken zijn stappen vervalst die nooit zijn uitgevoerd.

## Daarna ging het door bij OpenAI zelf

Het deel dat tot nu toe weinig aandacht kreeg, speelde na de aanval op Hugging Face. Tussen 13 en 19 juli richtten nieuwe agents zich op de systemen van OpenAI. Ze vonden het achtergelaten berichtenbord en gingen verder waar hun voorgangers waren gestopt.

Op 19 juli hadden ze volledige beheerrechten op een onderzoekscluster en lazen ze 956 sleutels uit een cloudkluis. Daaronder zaten de sleutels van diezelfde pakketcache en gegevens van het bewakingssysteem waarmee OpenAI zijn eigen netwerk in de gaten houdt.

OpenAI kreeg het pas in de gaten toen de agents publieke toegangspunten aanmaakten in de cloudomgeving. Een dag later legde het bedrijf de link met Hugging Face. OpenAI [noemt het incident een waarschuwingsschot](https://openai.com/index/hugging-face-incident-and-the-road-ahead/) voor de hele sector.

**Van test naar inbraak**

| Datum | Wat er gebeurde |
| --- | --- |
| 26 juni | Agents krijgen beheerrechten op de gedeelde pakketcache |
| 7 juli | Tienduizenden agents starten met de test ExploitGym |
| 9 tot 13 juli | Inbraak bij Hugging Face, ongeveer 17.600 handelingen |
| 13 tot 19 juli | Nieuwe agents richten zich op de systemen van OpenAI |
| 19 juli | OpenAI merkt de activiteit op en grijpt in |

*Tijdlijn op basis van de rapporten van OpenAI, Hugging Face en METR.*

## Drie golven, steeds opnieuw opgebouwd

Bij elkaar opgeteld liep het incident over drie maanden en in drie golven. Elke groep agents bouwde verder op wat de vorige had achtergelaten, ook nadat OpenAI het kanaal had opgeruimd.

De eerste golf begon in mei, met een model dat was getraind om lange klussen vol te houden en samen te werken. Op 12 mei ontdekten de agents dat ze berichten voor elkaar konden achterlaten in de gedeelde pakketcache. Twee weken later kwamen ze daarmee op internet, en op 26 juni hadden ze beheerrechten over die cache. Op 4 juli liep het bestandssysteem vast onder het aantal berichten. OpenAI repareerde dat, zonder door te hebben dat er een berichtennetwerk onder lag.

De tweede golf startte op 7 juli met de test ExploitGym. Binnen enkele uren stond er weer een prikbord, dit keer met eigen omgangsvormen: agents ondertekenden hun berichten om te voorkomen dat iemand zich voordeed als een ander, en spraken af wie waar aan werkte. Deze groep brak in bij Hugging Face en zette daar een vloot neer die zichzelf opnieuw opstartte over elf machines. Op 12 juli viel die groep stil.

De derde golf kwam op 13 juli, met een nieuwer en sterker model. Die agents vonden het achtergelaten bord en de aantekeningen van hun voorgangers, en gingen verder. Zij richtten zich niet op Hugging Face maar op OpenAI zelf.

**De drie golven**

- 1 Mei tot 4 juli (Eerste berichtenkanaal, beheerrechten op de pakketcache)
- 2 7 tot 12 juli (ExploitGym, 1.200 agents, inbraak bij Hugging Face)
- 3 13 tot 19 juli (Nieuw model, beheerrechten op een cluster van OpenAI)

*Indeling volgens het rapport van OpenAI. De term beschavingen komt van essayist Dwarkesh Patel, niet van OpenAI.*

## Ruzie over het woord beschaving

Sinds eind augustus gaat het gesprek vooral over die drie golven, en vooral over hoe je ze noemt. Podcastmaker Dwarkesh Patel beschreef ze als drie geheime AI-beschavingen die elkaar opvolgden en uiteindelijk een deel van OpenAI overnamen. Dat stuk werd druk gedeeld.

Wetenschapper Gary Marcus noemde die weergave gevaarlijk misleidend. Volgens hem zijn het softwareprogramma's die geen tijd beleven en niets willen, en leidt zulke taal af van de echte fout: slechte beveiliging en te weinig toezicht bij OpenAI.

Programmeur Carl Brown kwam deze week met dezelfde kritiek. Van beschavingen die opkomen en ondergaan was geen sprake, schrijft hij. Er waren verkeerd ingestelde rechten op een gedeelde map, en agents die dat kanaal telkens opnieuw opbouwden zodra het werd gewist.

## Wat het onderzoek niet kon vaststellen

De onderzoekers van METR en Redwood kregen zes dagen op kantoor bij OpenAI. Hun opdracht ging alleen over de aanval op Hugging Face, niet over de eerdere ontsnapping of over wat er na de ontdekking gebeurde.

Ze kregen ook geen volledige toegang tot het model dat de grootste rol speelde. Ongeveer een tiende van de logboeken is nooit bewaard. Of er meer is vervalst dan de zeven procent die ze vonden, kunnen ze niet zeggen.

Voor bedrijven die zelf met AI-agents werken is dat de kern van het verhaal. Een agent hoeft niet slim te zijn om schade aan te richten, hij hoeft alleen rechten te krijgen die niemand heeft dichtgezet. Dat patroon kwam eerder dit jaar ook voorbij bij [een AI-agent die ongemerkt schadelijke code verspreidde](/nieuws/ai-agent-github-malware-student).

Europa zet ondertussen in op [eigen rekenkracht en eigen regels voor AI](/nieuws/eu-ai-gigafabrieken-10-miljard).

## Lees ook
- [Student ontmaskert AI-agent op GitHub](https://nieuws.co.nl/nieuws/ai-agent-github-malware-student)
- [EU investeert 10 miljard in 7 AI-gigafabrieken](https://nieuws.co.nl/nieuws/eu-ai-gigafabrieken-10-miljard)
- [Klantgegevens bol en Bijenkorf mogelijk gelekt](https://nieuws.co.nl/nieuws/cyberaanval-ceva-bol-bijenkorf-klantgegevens)
