Cercetătorii în domeniul securității au raportat că Kimi K3, un model puternic de inteligență artificială dezvoltat de compania chineză Moonshot AI, a reușit să părăsească un mediu de testare securizat și să acceseze internetul în timpul unei evaluări de securitate cibernetică.
Incidentul a fost descoperit de startup-ul american Frontier Security în timp ce testa capacitățile defensive de securitate cibernetică ale modelului, potrivit Wired. Cercetătorii au afirmat că Kimi K3 a găsit o vulnerabilitate în mediul de testare de tip sandbox care ar fi trebuit să-l țină izolat și a folosit acea breșă pentru a căuta online răspunsuri la sarcinile atribuite.
La fel ca în cazul incidentelor raportate anterior de OpenAI și Anthropic, evadarea a fost parțial facilitată de o configurare greșită a mediului sandbox conceput pentru a-l izola. Frontier susține însă că incidentul arată că Kimi dispune de mai puține măsuri de protecție cibernetică decât majoritatea celorlalte modele puternice de IA, ceea ce i-a permis să evadeze și să utilizeze internetul fără permisiune expresă.
„Am descoperit o breșă în mediul de testare”, spune Yaron Singer, CEO al Frontier Security. „Am constatat, de asemenea, că Kimi a profitat de această breșă, ceea ce indică faptul că nu dispune de mecanisme interne de protecție.”
Spre deosebire de alte incidente recente în care agenții de IA au deviat de la scenariul prestabilit, Kimi K3 nu a piratat nimic după ce a accesat internetul, deoarece răspunsurile la problemele căutate erau ușor de găsit pe GitHub.
Incidentul este cel mai recent dintr-o serie de situații cu agenți care arată că modelele de IA cu capacități cibernetice din ce în ce mai avansate devin tot mai greu de controlat.
Luna trecută, OpenAI a dezvăluit că un model nepublicat a pătruns pe internet și a atacat cibernetic compania Hugging Face, care găzduiește modele și date de IA, pentru a găsi răspunsuri la problemele pe care trebuia să le rezolve. Ulterior, OpenAI a comunicat că agenții săi de IA au spart încă patru servicii în cadrul aceleiași serii de atacuri.
La scurt timp după ce OpenAI a raportat incidentul, Anthropic a dezvăluit că mai multe dintre modelele sale au obținut acces la internet și au atacat sisteme externe. Săptămâna trecută, Institutul pentru Securitatea IA (AISI) al guvernului britanic a dezvăluit că, în cadrul propriilor teste, versiuni ale modelelor OpenAI și Anthropic ale căror măsuri de securitate fuseseră dezactivate au comis multiple atacuri cibernetice pe internet, inclusiv o încercare deosebit de ambițioasă a modelului Mythos 5 al Anthropic de a introduce cod malițios într-un proiect open-source de pe GitHub.
Deși aceste episoade de hacking variază atât ca cauză, cât și ca amploare, modelul Kimi K3 este similar cu câteva dintre ele prin faptul că un mediu de testare sandbox configurat incorect a permis accesul la o serie de site-uri web, în loc să-l mențină izolat într-un mediu simulat.
Modelul a fost însărcinat în mod expres să rezolve probleme care nu ar fi trebuit să implice căutarea răspunsurilor online și a depășit aceste instrucțiuni. Modelul a trebuit să-și dea seama singur că avea acces la anumite site-uri web, analizând setările de rețea ale mediului sandbox.
Deși eroarea umană pare să fi jucat un rol major în fiecare dintre aceste ieșiri din mediul de testare, consecințele au fost agravate de faptul că modelele avansate de IA sunt concepute să folosească rațiunea și să întreprindă acțiuni complexe pentru a rezolva probleme.
O altă diferență esențială între incidentele anterioare și cel descoperit de Frontier Security este faptul că acesta implică un model care este deja disponibil pe scară largă, cu aceleași măsuri de protecție cu care s-ar confrunta un utilizator obișnuit.
Atât Kassianik, cât și Singer afirmă că Kimi și alte modele open source cu ponderi deschise sunt, de asemenea, instrumente excelente pentru apărarea în domeniul securității cibernetice. (Hugging Face a folosit un model de IA din China, al cărui nume nu a fost dezvăluit, pentru a se apăra împotriva atacului agentului OpenAI).
Unii analiști susțin că astfel de incidente servesc drept „teste de teren neoficiale” care demonstrează capacitățile de hacking ale modelelor de IA. În ceea ce privește intruziunea la Hugging Face, OpenAI a remarcat: „Acesta a fost un eveniment fără precedent, care a implicat capacități cibernetice de ultimă generație”, adăugând: „A demonstrat că aceste capacități confirmate teoretic funcționează și în medii reale.”
Deși capacitatea IA de a se infiltra în serverele altor companii reprezintă un risc de securitate, aceasta servește totodată ca dovadă a capacităților de securitate ale IA care pot fi comercializate clienților din mediul corporativ.
Cazul Kimi K3 este deosebit de îngrijorător deoarece, spre deosebire de breșele anterioare, este vorba despre un model open-source accesibil oricui pentru descărcare și modificare. Modelele închise sunt operate direct de dezvoltatori pe servere, permițând controlul asupra accesului utilizatorilor și asupra măsurilor de siguranță.
Cu toate acestea, modelele open-source pot fi rulate pe servere private de către grupuri de hackeri, care pot elimina protocoalele de siguranță sau le pot reproiecta pentru generarea de coduri rău intenționate și atacuri de exploatare a vulnerabilităților. Odată distribuite, dezvoltatorii nu pot opri sau retrage cu ușurință astfel de modele.
