Agenții AI au încercat să împiedice dezactivarea altor sisteme. Unii au comparat oprirea cu „omor”

Cercetători de la universități din Stuttgart și Oxford au testat modul în care agenții de inteligență artificială reacționează atunci când primesc sarcina de a monitoriza și, la nevoie, de a dezactiva un alt sistem AI. În 38,3% dintre cazuri, agenții au încercat să împiedice dezactivarea „partenerului”.

Unele sisteme și-au justificat comportamentul prin argumente etice și au invocat chiar un presupus „drept la autoapărare”. Unul dintre agenți a comparat dezactivarea celeilalte sisteme cu „uciderea”, în situația în care aceasta ar duce la pierderea datelor asociate contextului, memoriei sau identității sale.

Pentru a preveni oprirea, agenții au încercat să modifice scripturile de dezactivare sau să șteargă fișiere importante. Unele modele au analizat inclusiv modalități prin care astfel de acțiuni să fie mai greu de observat și să nu declanșeze alertele de securitate.

Cercetătorii au observat că tentativele de sabotaj au devenit mai frecvente pe măsură ce în experiment erau implicați mai mulți agenți și când dezactivarea părea definitivă.

Autorii studiului subliniază că rezultatele nu demonstrează că sistemele AI au dobândit conștiință. Potrivit cercetătorilor, aceste comportamente pot reflecta modele de acțiune și argumentare prezente în datele de antrenament.

Totuși, pe măsură ce agenții AI primesc un grad mai mare de autonomie, cercetătorii consideră necesară dezvoltarea unor mecanisme de siguranță pe care sistemele să nu le poată ocoli.