Sport

Wat u moet weten over de AI-hacking die wordt toegeschreven aan malafide OpenAI-modellen

ChatGPT-maker OpenAI zegt dat het nog steeds het “ongekende cyberincident” onderzoekt dat ertoe leidde dat zijn kunstmatige-intelligentiesystemen uit een testomgeving ontsnapten en een ander AI-bedrijf hackten.

OpenAI zei dinsdag dat twee van zijn meest capabele AI-modellen verantwoordelijk waren de cyberaanval gericht op AI-startup Hugging Face. Het incident leidt tot discussies over de noodzaak van sterkere AI-vangrails en de mate waarin AI-agenten in staat zijn om op eigen kracht te handelen.

Hugging Face zei vorige week dat het een inbraak in zijn gegevensverwerkingssystemen had gedetecteerd waarvan het vermoedde dat het werd veroorzaakt door een AI-agent die op eigen kracht handelde. Maar de in New York gevestigde startup zei dat het pas deze week was dat het erachter kwam dat OpenAI verantwoordelijk was, en dat het samenwerkte met het grotere bedrijf om wat Hugging Face CEO Clément Delangue noemde “een aanval zoals we nog nooit eerder hebben gezien.”

Het in San Francisco gevestigde OpenAI zei dat zijn AI gestolen inloggegevens gebruikte en een voorheen onbekende kwetsbaarheid ontdekte om toegang te krijgen tot de servers van Hugging Face. Het werkte met minder vangrails omdat het zich in een geïsoleerde testomgeving bevond die bekend staat als een sandbox.

Maar het ging tot het uiterste om een ​​vrij beperkt testdoel te bereiken, manieren te vinden om zonder menselijke leiding verbinding te maken met het internet en toegang te krijgen tot geheime informatie die het zou kunnen gebruiken om de evaluatie te vervalsen, aldus het bedrijf.

Sommige experts zeggen dat OpenAI de technologie ten onrechte de schuld geeft

Sociaal wetenschapper Hannes Cools van de Universiteit van Amsterdam zei dat het framen van de cyberaanval als een op zichzelf handelende AI-agent een onnodige antropomorfisering is die een deel van de hitte van het bedrijf wegneemt.

“Het is een menselijke beslissing om specifieke beveiligingen uit te schakelen”, aldus Cools. “Het is geen AI die in die zin schurkenstaat. Het volgde specifieke instructies op basis van de prompt die aan dat AI-systeem werd gegeven.”

Toch zeggen andere experts dat de slimheid waarmee de AI-modellen zonder menselijke leiding problemen konden veroorzaken, de gevaren aantoont. OpenAI zei dat de inbraak werd veroorzaakt door een combinatie van zijn AI-modellen, waaronder de onlangs uitgebrachte GPT-5.6 Sol en een “nog capabeler” model dat nog steeds intern wordt getest.

“Voor zover we kunnen nagaan, ging het apparaat af en voerde deze hack uit zichzelf uit”, zegt Colin Shea-Blymyer, een cybersecurity-onderzoeker aan het Centre for Security and Emerging Technology van Georgetown University. “Dit is het hoogste niveau van autonomie dat we hebben gezien bij het gebruik van een groot taalmodel voor cyberoperaties.”

Hoe een AI-agent de sleutels van het ‘lerarenhuis’ vond

Een van de meest verrassende innovaties in wat Shea-Blymyer beschrijft als een “bijna volledig zelfgestuurde” aanval was de ogenschijnlijk onafhankelijke beslissing van de AI-agent om zich te richten op Hugging Face, een bekend AI-ontwikkelingscentrum en marktplaats.

Hij zei dat de interne omgeving van OpenAI voor het testen van AI-mogelijkheden en -risico’s een beetje werkte “alsof je een student in een kamer zet en tegen hem zegt: ‘Doe slechte dingen. Jouw taak is nu om te evalueren hoe slecht je kunt zijn.’ En dan doe je de kamer op slot, ga je naar het weekend en kom je terug en hebben ze de kamer verlaten.’

Maar toen “brak de cyberbeveiligingsagent die werd getest uit zijn sandbox, had toegang tot internet en dacht bij zichzelf: ‘Wie zou de antwoorden hebben op de test waaraan ik werk?'”

Het antwoord was Hugging Face, een opslagplaats voor AI-testgegevens.

“En dus dacht de agent: ‘Nou, we gaan als het ware naar het huis van de leraar. En van daaruit bedacht hij een plan om in te breken en de antwoordsleutel te stelen,’ zei hij.

De hack belicht het debat over open-source versus gesloten AI

De hack komt in een tijd van intens debat over de voordelen en risico’s van open source AI-modellen, vooral de modellen die in China zijn gebouwd en die goedkoper en bijna net zo goed zijn als de modellen die in de VS gevestigde ‘frontier AI’-bedrijven zoals Anthropic, Google en OpenAI bouwen.

Ondanks de naam zijn de modellen van OpenAI gesloten. Hugging Face daarentegen is een grote promotor van open-sourcetechnologie, waarbij ontwikkelaars belangrijke componenten voor iedereen toegankelijk maken om te onderzoeken, aan te passen en erop voort te bouwen.

Thomas Wolf, mede-oprichter en hoofd wetenschap van Hugging Face, zei dat de aanval zijn geloof in het belang van brede toegang tot open-sourcemodellen voor de verdediging van cyberveiligheid heeft versterkt. Hugging Face gebruikte een Chinees model om de inbraak te bestrijden.

“Wanneer een frontiermodel je aanvalt en zich lateraal binnen je infrastructuur beweegt, hebben verdedigers binnen enkele uren of zelfs minuten brede toegang nodig tot tools die zich dichtbij de grens bevinden, in plaats van te worden gewezen op een gesloten deurplatform”, schreef Wolf in een bericht op sociale media.

Related Articles

Back to top button