OpenAI va introduce un „watermark” invizibil în textele generate pentru utilizatorii de ChatGPT și Codex din Uniunea Europeană, indiferent de planul folosit. Implementarea este programată pentru următoarele săptămâni, iar compania precizează că marcarea textului nu va deveni implicită la nivel global odată cu această lansare.
Tehnologia, numită textGrain, introduce un semnal statistic în alegerile de cuvinte ale modelului. Un detector poate căuta acest semnal pentru a evalua dacă un fragment conține un watermark OpenAI, însă rezultatul are limite: textele scurte sunt mai greu de identificat, iar editarea poate slăbi considerabil marcajul.
Cum funcționează watermark-ul pentru text
Marcajul nu presupune adăugarea unei etichete vizibile în răspuns. Semnalul este integrat în felul în care modelul selectează cuvintele, iar detectorul analizează ulterior textul pentru a căuta tiparul respectiv. Potrivit evaluărilor interne OpenAI, textGrain a egalat sau depășit performanța celorlalte metode testate, inclusiv SynthID pentru text. Compania subliniază însă că rezultatele bune în condiții ideale nu garantează detectarea corectă în utilizarea obișnuită.
La o rată țintă de rezultate fals pozitive de 1%, detectorul a identificat watermark-ul în aproximativ 80% dintre fragmentele de 200 de tokens pentru conținut precum psihologia. Pentru fragmente de 400 de tokens, rata a ajuns la aproximativ 95%. În cazul matematicii, unde există mai puțină libertate în alegerea cuvintelor, detectarea a fost semnificativ mai slabă. Un rezultat fals pozitiv înseamnă că detectorul semnalează un watermark care nu există. Un rezultat fals negativ apare când marcajul există, dar detectorul nu îl identifică.
Înlocuirea cuvintelor poate slăbi marcajul
Într-o evaluare separată, pe răspunsuri în engleză de 400 de tokens la întrebări din setul ELI5, înlocuirea unor cuvinte cu sinonime a redus puternic rata de detectare:
| Modificarea textului | Rata de detectare |
|---|---|
| Text nemodificat | Aproximativ 92% |
| 10% dintre cuvinte înlocuite cu sinonime | Aproximativ 66% |
| 25% dintre cuvinte înlocuite cu sinonime | Aproximativ 17% |
OpenAI afirmă că, în benchmark-urile folosite pentru evaluarea modelului Astra, nu a observat diferențe semnificative de performanță între răspunsurile cu și fără watermark. Compania intenționează să publice tehnologia în regim open source și să completeze raportul tehnic în săptămânile următoare.
Detectorul nu stabilește cine a scris textul
Un watermark poate indica faptul că un sistem OpenAI a generat sau procesat o parte dintr-un fragment. Nu măsoară însă contribuția umană și nu stabilește câtă judecată, creativitate sau editare a intervenit ulterior. Marcajul nu identifică utilizatorul, contul, promptul sau conversația. De asemenea, nu verifică exactitatea informațiilor și nu stabilește proprietatea asupra textului ori responsabilitatea pentru acesta.
Absența unui watermark detectabil nu demonstrează că textul a fost scris de un om. Fragmentul poate fi prea scurt, editat sau tradus, poate proveni de la un model incompatibil ori poate fi anterior introducerii tehnologiei.
Acces limitat la verificare
La lansare, detectorul va fi accesibil doar cercetătorilor și organizațiilor specializate aprobate, prin evaluarea individuală a solicitărilor. OpenAI justifică accesul restrâns prin riscul rezultatelor fals pozitive și al watermark-urilor nedetectate. Clienții API din întreaga lume vor putea activa opțional marcarea textului pentru anumite modele. Compania lucrează și cu parteneri cloud pentru disponibilitatea funcției prin serviciile acestora. Extinderea accesului la detector va depinde de evaluarea fiabilității și a modului în care rezultatele pot fi interpretate responsabil.
