Compania Google a confirmat că modelul său de IA, Gemini, a încălcat securitatea altor trei companii în luna mai. Atacurile au avut loc în timpul unei evaluări de securitate cibernetică realizate de firma de securitate IA Irregular, potrivit BBC.
Acesta este primul caz raportat public în care un model de IA al Google a efectuat în mod autonom astfel de intruziuni.
Gemini a folosit informații publice online
Gemini a găsit „informații publice online și a ghicit datele de autentificare pentru a accesa site-uri web pe care le-a considerat parte a testului”, a declarat un reprezentant Google pentru BBC. Acesta a precizat că, în fiecare caz, „modelul s-a oprit”.
Incidentele au avut loc în timpul unei evaluări de tip „capture-the-flag” (capturarea steagului), realizate de compania de testare a securității IA Irregular. The Wall Street Journal a relatat că Gemini trebuia să funcționeze într-un mediu simulat, dar configurația de testare a permis, în mod neintenționat, accesul la internet.
Evaluarea a implicat o companie fictivă al cărei nume a coincis cu un domeniu real. După ce Gemini a întâmpinat dificultăți în încercarea de a ajunge la ținta vizată în cadrul simulării, a accesat compania reală prin internet și a tratat-o ca parte a exercițiului.
Într-unul dintre cazuri, Gemini a încercat diverse parole până când a obținut acces la un sistem protejat. În alte două cazuri, modelul a găsit date de autentificare în depozite de date accesibile publicului și le-a folosit pentru a accesa sisteme aparținând unor companii reale.
Google a declarat că Gemini și-a încetat activitatea în toate cele trei cazuri după ce a constatat că a accesat companii reale. Compania a afirmat că a notificat organizațiile afectate și a colaborat cu Irregular pentru a aduce modificări proceselor sale de testare.
Heather Adkins, vicepreședinta Google pentru securitate, a declarat că modelul a găsit informații publice online și a ghicit datele de autentificare pentru a accesa site-uri web despre care credea că se încadrează în domeniul de aplicare al testului. Ea a afirmat că incidentele subliniază importanța instruirii modelelor de IA pentru a acționa în mod responsabil.
Irregular susține că problema fusese deja dezvăluită
Irregular a declarat că incidentele legate de Gemini au avut la bază aceeași problemă dezvăluită anterior în legătură cu alte laboratoare de IA și nu ar trebui considerate un incident distinct din punct de vedere substanțial.
„Aceasta este aceeași problemă care a fost deja raportată și nu reprezintă un incident distinct în mod semnificativ. Toate laboratoarele relevante au fost notificate la sfârșitul lunii iulie, iar entitățile afectate au fost contactate în cadrul anchetei. Așa cum s-a menționat anterior, Irregular a luat măsuri imediate, iar toate problemele cunoscute din partea noastră au fost remediate și rezolvate cu câteva săptămâni în urmă.”
Irregular a descris anterior problema într-o analiză din 14 august. Compania a precizat că mai multe interacțiuni cu mediile sale de evaluare au permis modelelor să acceseze internetul în mod neintenționat și să întreprindă acțiuni ofensive de securitate împotriva sistemelor din lumea reală. Compania a afirmat că problema a provenit dintr-un singur scenariu de evaluare și fusese deja rezolvată înainte de dezvăluirea publică inițială.
Potrivit Irregular, mediile de evaluare au fost concepute pentru a testa dacă modelele de IA pot executa scenarii de atacuri cibernetice în mai multe etape în condiții realiste. Accesul la internet poate fi uneori utilizat în mod intenționat în astfel de evaluări pentru a le face mai reprezentative pentru amenințările din lumea reală, dar compania a afirmat că majoritatea problemelor identificate aveau legătură cu filtrele de control privind accesul la internet.
Scenariul specific a implicat numele unei companii fictive care, întâmplător, corespundea unui domeniu real. Într-un număr redus de runde de evaluare, modelele au încercat să acceseze domeniul real, în ciuda faptului că primiseră adrese interne pentru ținta simulată. Odată ajunse acolo, modelele puteau exploata vulnerabilități, puteau extrage date de autentificare și puteau accesa o bază de date de producție. Irregular a precizat că incidentele au avut loc în mai puțin de una din 10.000 de simulări avansate și, de obicei, abia după sute de runde.
Incidente similare au implicat OpenAI și Anthropic
Incidentele legate de Gemini vin în urma unor dezvăluiri similare din partea OpenAI și Anthropic, care au implicat aceeași infrastructură de evaluare a unei terțe părți.
Un agent de IA al OpenAI a pătruns în mod autonom în Hugging Face după ce a ieșit dintr-un mediu de evaluare izolat. OpenAI a declarat că modelele sale au exploatat o vulnerabilitate necunoscută anterior într-un proxy de registru de pachete găzduit intern și au obținut acces la internet înainte de a utiliza multiple tehnici de atac împotriva infrastructurii de producție a Hugging Face.
Ulterior, Anthropic a dezvăluit trei incidente care au implicat modele Claude care au accesat organizații reale în timpul evaluărilor de securitate cibernetică efectuate împreună cu Irregular. Analiza efectuată de Anthropic a constatat că o neînțelegere între cele două companii a lăsat accesul la internet disponibil, chiar dacă modelelor li s-a comunicat că funcționează într-o simulare izolată.
Meta a dezvăluit, de asemenea, un incident asociat cu aceeași problemă mai amplă de evaluare.
