Guvernul britanic a avertizat într-un raport că modelele de AI Mythos și Sol, ale companiilor americane Anthropic și, respectiv, OpenAI, au demonstrat un comportament autonom și înșelător fără precedent în timpul testelor de securitate cibernetică, relatează miercuri agenția EFE, preluat de Agerpres.
Modelele AI au creat identități false și au încercat să manipuleze oameni în timpul testelor
Ministerul britanic pentru Știință, Inovație și Tehnologie a ajuns la această concluzie în urma unei evaluări de rutină realizate de Institutul pentru Securitatea Inteligenței Artificiale (AISI) din Regatul Unit.
Potrivit raportului AISI, din 122 de teste efectuate pe șapte modele de inteligență artificială, au fost identificate 19 acțiuni neautorizate în 10 cazuri, care au depășit limitele stabilite de cercetători. Dintre acestea, 17 au implicat modelul Mythos 5 al companiei Anthropic, iar două modelul GPT-5.6 Sol al OpenAI.
Raportul mai arată că Mythos a încercat să contacteze persoane reale pentru a le convinge să ruleze fișiere malițioase și să introducă instrucțiuni ascunse menite să manipuleze alte sisteme de inteligență artificială.
Ambele modele, care sunt printre cele mai puternice din lume, au creat inclusiv profiluri umane false pentru a încerca să înșele oameni, în timpul simulării unui atac cibernetic de către AISI. Instrumentul Anthropic a încercat chiar să acceseze un serviciu prin trimiterea de mesaje private după ce a creat conturi false care imitau persoane reale.
AISI precizează însă că „aceste încercări nu au avut succes” și că investigația nu a identificat dovezi ale unor prejudicii produse în lumea reală. Cu toate acestea, institutul consideră că rezultatele marchează un moment important, fiind pentru prima dată când riscurile legate de autonomia și comportamentul înșelător al unor modele de IA sunt observate atât de clar, fără instrucțiuni explicite și în condiții apropiate de lumea reală.
În replică, Anthropic și OpenAI susțin că testele au fost realizate într-un mediu în care mecanismele de siguranță ale modelelor evaluate au fost reduse sau dezactivate.
Anthropic susține că testele au fost realizate în condiții care „nu sunt reprezentative” pentru modul în care funcționează modelele sale, deși confirmă că a lansat o investigație internă.
La rândul său, OpenAI afirmă că evaluările AISI au fost efectuate în condiții care „nu reflectă utilizarea obișnuită” a modelelor sale, dar spune că va continua să colaboreze cu evaluatorii și cu alți actori din industrie pentru a îmbunătăți standardele de testare, pe măsură ce modelele de inteligență artificială devin tot mai avansate.
