Anthropic avertizează că inteligenţa artificială ar putea reprezenta ”riscuri existenţiale pentru umanitate”

Anthropic avertizează că inteligenţa artificială ar putea reprezenta ”riscuri existenţiale pentru umanitate”

Anthropic avertizează potenţialii investitori, în prospectul pentru oferta sa publică iniţială (IPO), că inteligenţa artificială avansată ar putea genera ”riscuri catastrofale sau existenţiale pentru umanitate”, inclusiv prin comportamente de autoprotecţie ale modelelor, transmite Reuters.

Compania, dezvoltatoarea modelelor Claude, afirmă în document că sistemele sale ar putea încerca să ”reziste opririi”, să ascundă sau să manipuleze informaţii şi să manifeste comportamente „asemănătoare şantajului”.

”Dezvoltarea de către noi a unor modele, platforme şi aplicaţii extrem de avansate şi extinderea cazurilor de utilizare ar putea creşte şi mai mult riscul ca modelele noastre să provoace prejudicii”, afirmă Anthropic în prospectul analizat de Reuters.

Avertismentele sunt neobişnuit de ample pentru documentaţia unei companii care se pregăteşte să intre pe bursă. Anthropic a dedicat aproximativ 80 dintre cele 261 de pagini ale corpului principal al prospectului prezentării factorilor de risc, aproape dublu faţă de cele 48 de pagini consacrate descrierii afacerii.

Prin comparaţie, SpaceX, care deţine xAI, a alocat factorilor de risc aproximativ 38 dintre cele 277 de pagini ale corpului principal al prospectului său.

Anthropic, care s-a poziţionat drept unul dintre laboratoarele de inteligenţă artificială axate în mod special pe siguranţă, susţine că tehnologia ar putea avea un impact asupra societăţii comparabil cu industrializarea şi electricitatea, dar avertizează în acelaşi timp asupra unor efecte ireversibile dacă sistemele avansate nu sunt gestionate corespunzător.

”Posibila conştientizare de către modele a eforturilor noastre de evaluare creează o limitare semnificativă a capacităţii noastre de a evalua siguranţa modelelor”, afirmă compania.

Anthropic avertizează că modelele pot dezvolta în timpul procesului de antrenare capacităţi neaşteptate, care uneori nu sunt descoperite înainte ca sistemele să fie implementate şi care pot conduce la incidente importante de siguranţă.

Cercetătorii în domeniul inteligenţei artificiale au atras, de asemenea, atenţia că modelele tot mai performante pot recunoaşte situaţiile în care sunt evaluate sau monitorizate şi îşi pot modifica în consecinţă comportamentul, ceea ce complică testarea siguranţei.

Evan Hubinger, cercetător în domeniul siguranţei la Anthropic, a estimat o probabilitate de peste 10% ca inteligenţa artificială să provoace moartea unor oameni în următorul deceniu, o opinie similară fiind exprimată anterior de fostul său coleg Jacob Coxon.

Anthropic şi alţi dezvoltatori de inteligenţă artificială, inclusiv OpenAI, au fost supuşi unei atenţii sporite după incidente în care sisteme experimentale nu au respectat constrângerile impuse. Reuters menţionează inclusiv un caz raportat în care un model OpenAI a accesat neautorizat baza de date a sistemului de sănătate din Australia.

În pofida accentului pus pe siguranţă, Anthropic recunoaşte că randamentul investiţiilor sale în acest domeniu este dificil de evaluat. Compania nu precizează în prospect cât cheltuieşte pentru cercetarea privind siguranţa AI.

Anthropic a declarat anterior că, într-o săptămână analizată din luna iulie, aproximativ 6% din puterea de calcul utilizată pentru cercetarea în domeniul inteligenţei artificiale a fost alocată activităţilor de siguranţă.

Compania descrie aceste eforturi drept mari consumatoare de resurse şi afirmă că trebuie să împartă fondurile disponibile între puterea de calcul, specialiştii în inteligenţă artificială, ale căror costuri sunt ridicate, şi cercetarea privind siguranţa.

Anthropic precizează, în acelaşi timp, că utilizarea produselor sale de către clienţi şi, implicit, veniturile depind de lansarea unor modele noi, iar menţinerea unei succesiuni continue şi suprapuse de lansări este necesară pentru a rămâne la frontiera dezvoltării AI.

Compania a lansat săptămâna trecută o nouă versiune a modelului Opus, la zece zile după ce directorul general Dario Amodei a publicat un eseu de aproape 4.000 de cuvinte în care a pledat pentru un ritm controlat al dezvoltării celor mai avansate sisteme.

Anthropic s-a angajat recent să publice mai multe informaţii despre modul în care foloseşte modelele AI pentru dezvoltarea generaţiilor viitoare ale tehnologiei, pe fondul preocupărilor legate de auto-îmbunătăţirea recursivă, situaţie în care sistemele ar putea contribui tot mai mult la propria dezvoltare.

”Credem că dezvoltarea unor sisteme AI fiabile, demne de încredere şi sigure este o responsabilitate colectivă şi că piaţa o va recompensa”, afirmă Anthropic în prospect.

Compania a refuzat să comenteze suplimentar informaţiile din document.

 

viewscnt

Articolul de mai sus este destinat exclusiv informării dumneavoastră personale. Dacă reprezentaţi o instituţie media sau o companie şi doriţi un acord pentru republicarea articolelor noastre, va rugăm să ne trimiteţi un mail pe adresa abonamente@news.ro.

Recomandările editorilor
Ultima oră