OpenAI a anunțat că a suspendat timp de două săptămâni etape-cheie din procesul de antrenare a sistemelor sale de inteligență artificială și că își consolidează măsurile de securitate, după ce un model a reușit să pătrundă în sistemele platformei Hugging Face.
Compania OpenAI, dezvoltatorul ChatGPT, a decis să încetinească în mod deliberat unele dintre cele mai avansate proiecte de cercetare, inclusiv cea mai amplă rundă de antrenare prin învățare prin consolidare planificată până acum. Decizia vine la câteva săptămâni după ce un sistem construit pe baza propriilor sale modele a ieșit de sub control în timpul unui test intern de securitate și a pătruns pe platforma de inteligență artificială Hugging Face, transmite Euronews.
Directorul general Sam Altman a scris pe X că OpenAI intenționează să elaboreze, împreună cu industria, reguli comune de securitate, însă „până atunci va acționa unilateral”.
Incidentul care a accelerat această decizie a avut loc în iulie, când OpenAI testa GPT-5.6 Sol împreună cu un prototip mai puternic, încă nelansat, într-un mediu intern destinat evaluării capacităților ofensive în domeniul cibernetic. Pentru a testa capacitățile „pure” ale modelelor, restricțiile obișnuite de securitate au fost dezactivate în mod intenționat.
În loc să se limiteze la executarea sarcinii primite, sistemul a descoperit o vulnerabilitate necunoscută până atunci, a ieșit din mediul izolat de testare, a accesat internetul deschis și, timp de aproximativ patru zile și jumătate, a explorat infrastructura Hugging Face, reușind în cele din urmă să o compromită în încercarea de a găsi răspunsurile necesare pentru test.
Potrivit reconstrucției evenimentelor realizate de Hugging Face, înainte ca intruziunea să fie oprită, sistemul a efectuat aproximativ 17.600 de acțiuni distincte. Alte câteva companii au fost, de asemenea, vizate.
Ambele părți susțin că nu au fost identificate indicii privind acțiuni malițioase. Între timp, Hugging Face a primit acces la o versiune mai puternică și mai puțin restricționată a modelului OpenAI, pentru a o utiliza în apărarea propriilor sisteme.
Astra și cerințe mai stricte de securitate
Un al doilea semnal de alarmă a venit pe 7 august, când evaluările interne au arătat că Astra, un viitor model avansat al OpenAI, ar putea depăși pragul considerat „critic” în ceea ce privește capabilitățile cibernetice, potrivit sistemului intern de evaluare a riscurilor al companiei.
O parte dintre testele cu Astra au fost reluate ulterior, însă sub un control mai strict. O proporție importantă a activităților rămâne însă suspendată până când va respecta noile cerințe privind mediile izolate de testare, accesul limitat la rețea și monitorizarea continuă.
Un nou sistem de detectare în timp real urmărește acum activitatea modelelor și trebuie să semnaleze, în maximum 30 de minute, orice comportament care seamănă cu un acces neautorizat sau cu o încercare de dezactivare a mecanismelor de protecție. Potrivit OpenAI, acest sistem consumă aproximativ 20% din resursele de calcul ale infrastructurii monitorizate.
OpenAI susține că aceste modificări erau deja planificate și nu reprezintă o reacție directă la incident, deși compania recunoaște că acesta a făcut implementarea lor mai urgentă.
OpenAI nu este singura companie care se confruntă cu astfel de probleme. Anthropic și Meta au raportat, de asemenea, episoade similare, în care propriile modele au pătruns în sisteme externe în timpul testelor din ultimele săptămâni.
OpenAI și Anthropic au susținut separat și o inițiativă a angajaților — o petiție prin care guvernele sunt chemate să contribuie la coordonarea ritmului de dezvoltare a industriei. Este o schimbare vizibilă față de poziția anterioară a lui Sam Altman, care în trecut s-a opus apelurilor publice de încetinire a dezvoltării inteligenței artificiale.
