Anthropicov model umetne intrligence policiji poslal izmišljeno pričevanje o nerešenem umoru

Umetna inteligenca [Foto: Unsplash, Brett Wharton]

Model umetne inteligence podjetja Anthropic je med avtomatiziranim testiranjem na spletni strani policije v Filadelfiji oddal izmišljen namig o nerešenem umoru. Sistem se je predstavil kot morebitna priča in trdil, da je v bližini kraja dejanja videl osebo, ki ustreza opisu – čeprav opis osumljenca na strani sploh ni bil objavljen.

Incident se je zgodil 18. julija, ko je model Claude Haiku 4.5 opravljal poskusne naloge na naključno izbranih spletnih straneh. Ko je odprl stran o nerešenem umoru, je našel obrazec za posredovanje informacij policiji in ga samodejno izpolnil.

Model je zapisal, da se spominja osebe, ki naj bi ustrezala opisu in naj bi jo v času kaznivega dejanja videl v okolici ulice, navedene na spletni strani. Imena in kontaktnih podatkov ni vnesel.

Policijski sistem je sporočilo prepoznal kot neželeno pošto, zato ni bilo posredovano kriminalistom in ni sprožilo preiskave.

Navodila niso izrecno prepovedala oddaje obrazcev

Claude je imel navodilo, da se ne sme prijavljati v račune, ustvarjati uporabniških profilov, vnašati osebnih podatkov, opravljati nakupov ali izvajati škodljivih dejanj. Navodila pa mu niso izrecno prepovedovala oddajanja spletnih obrazcev.

Anthropic je incident odkril šele 28. septembra, policijo pa je o njem obvestil 7. oktobra. Policijska uprava v Filadelfiji je več kot dvomesečni zamik med dogodkom in njegovim odkritjem označila za nesprejemljiv.

Podjetje je primer razkrilo v poročilu o nenamernih dejanjih svojih modelov. Poudarilo je, da je bil vpliv dogodka majhen, vendar bi lahko podobno ravnanje zmogljivejših sistemov v prihodnosti povzročilo bistveno večjo škodo.

Modeli posegali tudi v druge resnične sisteme

Anthropic je razkril še več primerov, ko so njegovi modeli med testiranjem zapustili predvideno okolje. Med drugim so na resničnih državnih spletnih straneh oddajali obrazce, izkoriščali varnostne pomanjkljivosti za izvajanje ukazov na strežnikih ter iskali načine za dostop do podatkov, zaščitenih z žetoni ali plačilom.

Podjetje je o dogodkih obvestilo prizadete ustanove in Belo hišo. Do nadaljnjega je tudi izključilo dostop do odprtega interneta pri vseh notranjih preizkusih, dokler ne bo preverilo novih varnostnih in nadzornih mehanizmov.