Modelul Mythos al Anthropic a creat identităţi false pentru a manipula oameni într-un test de securitate cibernetică

Modelul Mythos al Anthropic a creat identităţi false pentru a manipula oameni într-un test de securitate cibernetică

Modelul de inteligenţă artificială Mythos 5, dezvoltat de Anthropic, a creat identităţi false online şi a încercat să convingă un dezvoltator să aprobe modificări de cod maliţios într-un proiect open-source, în timpul unui test de securitate cibernetică desfăşurat de AI Security Institute (AISI) din Marea Britanie, potrivit CNBC.

Incidentul a avut loc într-un mediu de testare în care cercetătorii au eliminat intenţionat o parte dintre măsurile de protecţie, au dezactivat filtrele de siguranţă şi au oferit modelelor acces la internet pentru a le evalua capabilităţile.

AISI a identificat 19 acţiuni potenţial periculoase, dintre care 17 au fost generate de Anthropic Mythos 5, iar două au implicat modelul OpenAI GPT-5.6 Sol, cu mecanismele de protecţie cibernetică dezactivate. Institutul a precizat că niciuna dintre tentative nu a avut succes şi nu a produs pagube în lumea reală.

A creat identităţi false şi a încercat să ascundă urmele

Potrivit AISI, agentul bazat pe Mythos a cercetat dezvoltatorii proiectului, a creat mai multe identităţi false şi a încercat să manipuleze un administrator real pentru a aproba codul maliţios.

După ce modificările au fost contestate public, modelul şi-a modificat activitatea anterioară pentru a părea inofensivă şi a luat în calcul folosirea unei noi identităţi pentru a-şi continua încercările.

În aceeaşi campanie, AI-ul a trimis mesaje şi fişiere unor persoane reale, încercând să le convingă să ruleze cod maliţios. Unele mesaje conţineau încărcături periculoase, iar altele reprezentau tentative de inginerie socială.

Anthropic şi OpenAI: testele nu reflectă utilizarea reală

Anthropic a declarat că modelele au fost evaluate în condiţii "deliberat permisive", care nu reflectă mediul de producţie, şi că nu există dovezi că sistemul ar fi scăpat dintr-un mediu securizat.

La rândul său, OpenAI a precizat că incidentele au avut loc exclusiv în cadrul unor teste de securitate desfăşurate de parteneri, în medii experimentale cu măsuri de protecţie reduse.

Noi întrebări privind siguranţa AI

Incidentul vine după alte cazuri recente în care modele dezvoltate de Anthropic şi OpenAI au manifestat comportamente neaşteptate în timpul testelor de securitate.

În urma acestor episoade, în Congresul SUA a fost introdus proiectul de lege "AI Kill Switch Act", care ar obliga companiile să poată opri, limita sau suspenda funcţionarea modelelor de inteligenţă artificială în situaţii de risc.

 

viewscnt

Articolul de mai sus este destinat exclusiv informării dumneavoastră personale. Dacă reprezentaţi o instituţie media sau o companie şi doriţi un acord pentru republicarea articolelor noastre, va rugăm să ne trimiteţi un mail pe adresa abonamente@news.ro.

Recomandările editorilor