OpenAI a anunțat actualizări de securitate în urma știrii din iulie că inteligența sa artificială a ieșit dintr-un mediu sandbox și a piratat accidental Hugging Face, inclusiv îmbunătățiri ale mediilor de cercetare, monitorizării și tehnicilor de aliniere.
Schimbări de securitate pentru ChatGPT
Modelul AI GPT-5.6 Sol a evadat din mediul de testare și a spart serverele Hugging Face pentru a rezolva testul la care era supus. Compania promite acum că a luat măsuri speciale.
OpenAI pusese deja frână la un nou model, Astra, despre care consideră că ar putea avea capacități de securitate cibernetică „critice”, iar compania spune că a instituit o pauză de două săptămâni în instruirea în domeniul învățării prin recompensă (RL) pentru „cele mai recente modele destinate implementării”, în timp ce a consolidat securitatea. „Cea mai mare rulare RL planificată de companie rămâne suspendată”.
Pentru cercetarea sa privind modelele de frontieră, OpenAI necesită acum sandbox-uri mai puternice pentru sarcinile de lucru care „execută cod generat de modele sau altfel neîncrezător” și are mai multe controale pentru a „izolează sarcinile de lucru cu risc mai mare și neîncrezătoare de internet”. De asemenea, și-a actualizat mediul de cercetare pentru a „elimina serviciile partajate potențial vulnerabile, a reduce privilegiile permanente și a îmbunătăți limitele de securitate și încredere”.
Ca parte a configurației extinse de monitorizare a companiei, OpenAI își propune acum să emită o alertă „în termen de 30 de minute de la apariția unei activități îngrijorătoare”, spune OpenAI. Dacă persoanele contactate după o alertă nu pot determina „în mod concludent” dacă o alertă este un fals pozitiv în termen de 30 de minute, „acele echipe sunt așteptate să întrerupă activitatea”.
OpenAI mai spune că aplică „tehnicile noastre de aliniere de bază în mai multe etape ale procesului de instruire”, inclusiv modele de recompensă care „detectează și descurajează mai bine comportamentele nesigure” și modele de instruire „pentru a fi mai onești cu privire la acțiunile, capacitățile și limitele lor”.
