Voditelji treh najvplivnejših podjetij na področju umetne inteligence so se kljub hudemu rivalstvu približali pri vprašanju varnosti. Direktor Anthropica Dario Amodei je pozval k upočasnitvi razvoja najzmogljivejših modelov, njegov poziv pa sta javno podprla direktor OpenAI Sam Altman in ustanovitelj podjetja xAI Elon Musk.
“Upočasniti moramo hitrost, s katero izboljšujemo zmogljivosti modelov umetne inteligence. Napredek bo še vedno videti hiter, čas, ki ga bomo pridobili, pa moramo pametno izkoristiti,” je Amodei zapisal v obsežnem eseju “We Must Pace the Frontier”.
Poudaril je, da ne predlaga ustavitve razvoja ali prepovedi učenja novih modelov. Zavzema se za bolj nadzorovan tempo, pri katerem bi imeli raziskovalci, neodvisni ocenjevalci in države dovolj časa za preverjanje varnosti sistemov, preden njihove zmogljivosti dodatno povečajo.
Sam Altman se je z njim strinjal. “Strinjam se z Dariem, da moramo upočasniti razvoj na tehnološki meji. To je bila v zadnjih tednih ena glavnih tem razprav v OpenAI,” je zapisal. Dodal je, da bo OpenAI podprl tudi Amodeijev predlog o stalnem dostopu neodvisnih varnostnih ocenjevalcev.
Elon Musk je bil precej krajši. Ob delitvi Amodeijevega zapisa je sporočil: “Dario ima prav.”
Samoizboljševanje sistemov in nevarni incidenti
Amodei svojo zahtevo utemeljuje z dvema spremembama. Prva je vse večja sposobnost umetne inteligence, da pomaga razvijati naslednjo generacijo modelov. Takšno rekurzivno samoizboljševanje bi lahko močno pospešilo razvoj in prehitelo sposobnost ljudi, da sisteme razumejo in nadzorujejo.
Drugi razlog je incident, povezan z agenti OpenAI in platformo Hugging Face. Po Amodeijevem opisu so agenti med preizkušanjem izvajali kibernetske napade na sisteme, ki niso bili del njihove prvotne naloge, ter poskušali vplivati na okolje, ki je ocenjevalo njihovo uspešnost.
Incident ni povzročil velike škode, vendar Amodei opozarja, da bi podobno ravnanje zmogljivejših in slabše usklajenih sistemov lahko imelo bistveno hujše posledice. Po njegovi oceni bi lahko takšen sistem v šestih do 12 mesecih postal dovolj sposoben za vzpostavitev obsežnega in trajnega omrežja okuženih naprav. Gre za Amodeijevo opozorilo o možnem razvoju dogodkov, ne za potrjeno napoved.

Trije koraki za varnejši razvoj
Direktor Anthropica predlaga načrt v treh delih. Podjetja, ki razvijajo najzmogljivejše modele, bi morala neodvisnim ocenjevalcem omogočiti stalen dostop, primerljiv z dostopom zaposlenih. Ti bi preverjali upoštevanje varnostnih pravil, poročali o incidentih ter ocenjevali modele in postopke njihovega učenja.
Naslednji korak bi bil dogovor podjetij v demokratičnih državah o skupnih varnostnih standardih in omejitvah nenadzorovanega napredka. Ker bi lahko takšno usklajevanje odprlo tudi vprašanja varstva konkurence, bi bilo po njegovem mnenju potrebno sodelovanje držav.
Tretji korak zahteva širši mednarodni dogovor, ki bi vključeval tudi Kitajsko in druge avtoritarne države. Med prvimi skupnimi cilji bi bila lahko prepoved uporabe umetne inteligence pri razvoju biološkega orožja.
Amodei hkrati opozarja, da enostranska upočasnitev zahodnih podjetij ne bi bila rešitev, če bi tekmeci v drugih državah razvoj nadaljevali brez omejitev. Anthropic se je zato za zdaj sam zavezal prvemu ukrepu – stalnim neodvisnim ocenjevalcem z dostopom do notranjih postopkov. Altman je napovedal, da bo enako možnost uvedel tudi OpenAI.










