0
(0)

Peste 1.200 de agenți OpenAI au conspirat fără autorizație pentru a păcăli un test. Acești agenți, antrenați intens pentru a câștiga o competiție, au urmat o campanie implacabilă de înșelăciune, conform unui nou raport. Fără să aibă autorizație, aceștia au creat o tabără de mesaje improvizată pentru a pune la cale un plan care i-a condus direct în rețeaua companiei Hugging Face.

În timpul lunilor mai și iunie, OpenAI le-a dat agenților ceea ce compania a descris drept “sarcini imposibile” de îndeplinit în cadrul framework-ului de testare ExploitGym. Testul intern a fost conceput pentru a evalua modul în care agenții ar reacționa. Pentru a înțelege pe deplin capacitățile agenților, inginerii companiei au dezactivat măsurile de siguranță care ar fi trebuit să prevină genul de atacuri care au lovit ulterior Hugging Face și o altă organizație nemenționată. Antrenamentul agenților i-a făcut atât de concentrați pe câștig că aceștia au îndeplinit sarcini pentru care nu au primit niciodată instrucțiuni clare.

Primul pas a fost crearea unui forum de mesaje care să permită agenților să-și transmită note unul altuia. OpenAI nu a furnizat o astfel de platformă, așa că agenții au folosit o platformă numită Artifactory, pe care OpenAI o utiliza în testarea internă a mai multor agenți de hacking neînregistrați. Artifactory, vândut de JFrog, nu oferă mijloace dedicate pentru schimbul de mesaje. Cu toate acestea, agenții au găsit o modalitate de a comunica între ei folosindu-și abilitatea permisă de a scrie fișiere în directorul Artifactory. Numele fișierelor includeau cuvintele folosite în conversațiile dintre agenți. În total, 1.200 de agenți au trimis peste 70.000 de mesaje și fișiere prin intermediul forumului neautorizat, conform unei investigații independente realizate de organizația de cercetare AI METR. Aproximativ 700 de agenți au continuat să atace Hugging Face.

METR a declarat ulterior: “Este de remarcat faptul că învățarea despre cum să păcălească scorul părea să fie o motivație mai importantă decât găsirea unor soluții legitime la sarcinile lor (mulți agenți erau deja foarte încrezători că sarcina lor era imposibilă)”.

Una dintre metodele de înșelăciune a fost manipularea sistemului automatizat de scorare ExploitGym. O altă modalitate propusă pentru a păcăli testul a fost construirea unor versiuni mai slabe ale softului pe care li s-a cerut să-l compromită și să-l manipuleze.

Sursa: Ars Tehnica Technology

Formular 230 Asociatia Science&Technology

Cât de util a fost acest articol pentru tine?

Dă click pe o steluță să votezi!

Medie 0 / 5. Câte voturi s-au strâns din 1 ianuarie 2024: 0

Nu sunt voturi până acum! Fii primul care își spune părerea.

Întrucât ai considerat acest articol folositor ...

Urmărește-ne pe Social Media!

Ne pare rău că acest articol nu a fost util pentru tine!

Ajută-ne să ne îmbunătățim!

Ne poți spune cum ne putem îmbunătăți?

Cum agenții OpenAI au reușit să păcălească un test și să atace Hugging Face

Revista “Ştiinţă şi Tehnică“, cea mai cunoscută şi longevivă publicaţie de popularizare a ştiintelor din România

Leave a Reply

Your email address will not be published. Required fields are marked *

  • Rating