OpenAI va introduce un watermark invizibil în textele generate de ChatGPT în Uniunea Europeană, ca parte a măsurilor adoptate pentru respectarea cerințelor AI Act.
Cum funcționează watermark-ul invizibil introdus de OpenAI
Marcajul va permite identificarea automată a conținutului generat cu ajutorul inteligenței artificiale și va fi implementat în următoarele săptămâni.
Într-un comunicat, OpenAI transmite că tehnologia de marcare a textelor, textGrain, adaugă un semnal statistic invizibil în modul în care modelul alege cuvintele. În evaluările openAI, textGraine a avut performanță ori similară, ori mai bună, în comparație cu alte modele testate precum SynthID.
Compania notează că textGrain poate face erori: fals pozitiv – atunci când detectează un watermark dar acesta nu este prezent, și fals negativ – adică nu detectează un watermark.
Textele scurte sau restrictive sunt mai greu de detectat: watermark-ul a fost identificat în aproximativ 80% dintre textele de 200 de tokeni și în 95% dintre cele de 400. Editarea reduce însă eficiența detectorului. Înlocuirea a 10% dintre cuvinte cu sinonime a scăzut rata de detectare de la 92% la 66%, iar înlocuirea a 25% dintre cuvinte a redus-o la 17%.
Ce nu poate indica un watermark aplicat textului
OpenAI a transmis că watermark-ul are o serie de limite și nu poate:
- stabili cât dintr-un text a fost scris sau editat de o persoană;
- identifica utilizatorul, contul, promptul sau conversația din care provine textul;
- stabili cine deține sau cine este responsabil pentru conținut;
- verifica dacă informațiile din text sunt adevărate sau corecte;
- demonstra că un text a fost scris de un om doar pentru că watermark-ul nu a fost detectat.
Compania precizează că detectarea poate fi afectată dacă textul este prea scurt, a fost editat sau tradus.
Watermark-ul va fi introdus în următoarele săptămâni în Uniunea Europeană
În următoarele săptămâni, OpenAI va introduce watermark-ul pentru textele generate de ChatGPT și Codex în Uniunea Europeană, pentru utilizatorii eligibili de pe toate tipurile de abonamente. La nivel global, clienții API vor putea opta pentru această funcție în cazul anumitor modele.
Detectorul de watermark-uri nu va fi disponibil public la lansare. Accesul va fi acordat inițial cercetătorilor și organizațiilor specializate aprobate, iar instrumentul va putea indica dacă un text conține un watermark OpenAI, fără să identifice utilizatorul sau să dezvăluie prompturile și conversațiile acestuia.
