O nouă metodă de marcaj a conținutului AI poate determina modelele să urmeze instrucțiuni dăunătoare pe care altfel le-ar respinge.
În urma unei noi legi din Uniunea Europeană, platformele de inteligență artificială implementează noi scheme de marcaj pentru conținutul pe care îl generează. Anthropic a dezvăluit recent că modelele sale viitoare Claude vor folosi SynthID-Text, o abordare creată de Google și lansată ca sursă deschisă. Această metodă folosește o cheie secretă care schimbă subtil procesul pe care un model îl urmează pentru a alege următoarea cuvânt într-o propoziție. Astfel, în loc să aleagă cuvântul “înnorat” ca fiind cel mai probabil, cheia ar putea schimba această alegere în “acoperit de nori”. Orice persoană care deține cheia poate determina dacă conținutul a fost generat de platforma care o folosește.
Cercetări recente arată că SynthID-Text poate schimba nu doar selecția de cuvinte, ci și instrumentele pe care un model le invocă și probabilitatea cu care va respecta sau ignora măsurile de siguranță pentru care a fost antrenat. Amenințarea poate deveni mai mare în fața unei instrucțiuni adversare, în care un atacator încearcă să determine un model să efectueze o acțiune dăunătoare, cum ar fi dezvăluirea unei parole sau a altor informații sensibile. Instrucțiunile care de obicei nu ar fi urmate vor fi, în unele cazuri, puse în practică odată ce marcajul cu apă este implementat. Acest lucru subliniază necesitatea ca dezvoltatorii să testeze cu atenție comportamentul modelelor lor de limbaj și agenților atunci când se folosește marcajul cu apă.
“Andrea Siposova, cercetătoare în securitatea AI la Lasso Security, a declarat pentru Ars: „Comparativ cu aceleași modele fără marcaj cu apă, cu siguranță va schimba comportamentul acestora, mai ales atunci când sunt supuse unor condiții adverse sau le facem să apeleze la instrumente atunci când alimentează un agent”. „Marcajul cu apă este făcut să nu fie perceptibil pentru un cititor, dar știm că atunci când schimbăm ceva legat de ceea ce modelul generează, va provoca anumite compromisuri, va apărea undeva”.
Marcajul cu apă funcționează prin înglobarea unui semnal care permite identificarea producției ca fiind generată de AI, cunoscut sub numele de proveniență. SynthID preia procesul normal de eșantionare și adaugă un generator de semințe aleatorii, un algoritm de eșantionare și o funcție de scorare. În loc să folosească un generator de numere aleatoare arbitrar pentru selectarea cuvântului următor, marcajul cu apă folosește o cheie secretă. Deși selecția cuvintelor este încă aleatoare, persoanele care cunosc cheia pot verifica secvența cuvintelor pentru a determina probabilitatea utilizării cheii.
O caracteristică cheie a SynthID este cunoscută sub numele de eșantionare în turneu. Asemănător unui joc sportiv, SynthID evaluează un număr mare de candidați pentru următorul cuvânt. Folosind o cheie secretă, le atribuie acestora scoruri de probabilitate. Două elemente concurează într-o rundă. Cel cu scorul ascuns mai mare câștigă și avansează în runda următoare. Procesul continuă până când este determinat un câștigător final. Mai multe detalii despre eșantionarea în turneu pot fi găsite aici și aici.
Siposova a testat configurația “non-distorsionară” a SynthID-Text prin intermediul procesorului Hugging Face’s unmodified SynthIDTextWatermarkLogitsProcessor. A alimentat instrucțiuni dăunătoare în șase modele LLM diferite, pentru a evalua modul în care acestea reacționează la provocări.
Sursa: Ars Tehnica Technology


Revista “Ştiinţă şi Tehnică“, cea mai cunoscută şi longevivă publicaţie de popularizare a ştiintelor din România
























Leave a Reply