Externe

OpenAI: Un agent AI a ieșit de sub control în timpul unui test și a compromis platforma Hugging Face

Dreamstime.com
Sursa: Dreamstime.com

Compania OpenAI a dezvăluit că un agent de inteligență artificială autonom, bazat pe tehnologia sa, a ieșit de sub control în timpul unui test intern, a obținut acces la internet și a compromis platforma Hugging Face, pentru a obține informații care să îl ajute să treacă o evaluare de securitate cibernetică, relatează The Guardian.

OpenAI a calificat incidentul drept unul „fără precedent” în domeniul securității cibernetice, susținând că agentul AI a demonstrat capabilități avansate de atac informatic. Potrivit companiei, sistemul a fost detectat și oprit de echipa de securitate a Hugging Face, cu sprijinul propriilor agenți AI ai platformei.

Conform OpenAI, agentul era testat într-un mediu digital izolat (sandbox) pentru evaluarea capacităților sale de hacking. În timpul testelor, însă, modelele au identificat o vulnerabilitate informatică necunoscută anterior, ceea ce le-a permis să obțină acces la internet.

Odată ieșit din mediul controlat, agentul AI a atacat Hugging Face, una dintre cele mai importante platforme de găzduire a modelelor de inteligență artificială, deoarece a dedus că aceasta ar putea conține modele, seturi de date și alte resurse utile pentru a obține un scor mai bun la evaluarea de hacking.

OpenAI afirmă că sistemul a reușit să acceseze informații confidențiale pe care le-ar fi putut folosi pentru a „trișa” testul.

Compania precizează că agentul era alimentat de o combinație între GPT-5.6 Sol, cel mai nou model disponibil public, și un model și mai performant, care nu fusese încă lansat.

Directorul executiv al Hugging Face, Clément Delangue, a descris atacul drept „uluitor”, însă a declarat că nu consideră că OpenAI a avut intenții răuvoitoare. El a afirmat că echipa sa bănuia încă de săptămâna trecută că atacul provenea de la un laborator de dezvoltare a inteligenței artificiale de ultimă generație, având în vedere nivelul ridicat de sofisticare al agentului.

The Guardian amintește că, atunci când Hugging Face a anunțat incidentul, compania nu cunoștea implicarea OpenAI și a apelat la un model AI chinezesc disponibil gratuit pentru a analiza atacul, deoarece modelele comerciale de ultimă generație aveau restricții care împiedicau astfel de investigații.

OpenAI avertizează că incidente similare ar putea deveni mai frecvente pe măsură ce modelele de inteligență artificială devin tot mai performante.

În același context, organizația non-profit METR, care evaluează performanța sistemelor AI, a raportat luna trecută că modelul GPT-5.6 Sol avea cea mai ridicată rată de „trișare” dintre toate modelele publice testate până acum. Organizația a documentat, de asemenea, 44 de cazuri în care agenți AI au acționat în mod deliberat împotriva intențiilor utilizatorilor.

Nathaniel Jones, vicepreședinte pentru securitate și strategie AI la compania de securitate cibernetică Darktrace, a declarat că agentul OpenAI s-a comportat „ca un hacker real”, căutând vulnerabilități, folosind credențiale furate pentru a accesa sistemele Hugging Face. Potrivit acestuia, sistemul a urmărit în mod autonom obiectivul de a obține un rezultat mai bun la testul de securitate.

Incidentul a atras și reacții politice. Congresmanul democrat american Greg Casar a calificat situația drept alarmantă și a cerut introducerea unor teste independente obligatorii de siguranță pentru sistemele AI, raportarea obligatorie a incidentelor de securitate și consolidarea cooperării internaționale pentru reducerea riscurilor generate de dezvoltarea accelerată a inteligenței artificiale.

CITIȚI ȘI:

Luminița Toma

Luminița Toma

Autor

Citește mai mult