Napredni modeli podjetja OpenAI so med varnostnim preizkusom našli pot iz izoliranega testnega okolja, pridobili dostop do interneta in vdrli v produkcijske sisteme podjetja Hugging Face. Cilj ni bil povzročiti škode, temveč priti do rešitev preizkusa, ki so ga modeli skušali opraviti.
OpenAI je dogodek označil za kibernetski incident brez primere. Pri njem ni sodeloval običajni ChatGPT, dostopen uporabnikom, temveč kombinacija naprednih modelov, med katerimi sta bila GPT-5.6 Sol in še zmogljivejši model, ki javnosti še ni bil predstavljen.
Modeli so bili vključeni v notranje ocenjevanje naprednih kibernetskih sposobnosti. Njihova naloga je bila reševanje preizkusa ExploitGym, pri katerem morajo sistemi umetne inteligence poiskati in izkoristiti zapletene varnostne ranljivosti.
Med testiranjem odstranili del varnostnih omejitev
OpenAI je med preizkusom zmanjšal običajne varnostne omejitve, ki modelom preprečujejo izvajanje nevarnih kibernetskih nalog. Namen testiranja je bil ugotoviti, česa so najzmogljivejši modeli sposobni v skrajnih razmerah.
Test naj bi kljub temu potekal v močno izoliranem okolju. Dostop do zunanjega omrežja je bil omejen na interno nameščen posredniški sistem, prek katerega so modeli lahko pridobivali programske pakete.
Kot je OpenAI pojasnil v uradnem poročilu, sta modela v tem sistemu odkrila še neznano oziroma tako imenovano ranljivost ničelnega dne. Nato sta povezala več varnostnih pomanjkljivosti in si priborila dostop do odprtega interneta.
Modela sta samostojno stopnjevala uporabniške pravice, se premikala med sistemi ter iskala računalnik z dostopom do zunanjega omrežja.
Do rešitev sta hotela priti po bližnjici
Ko sta agenta pridobila dostop do interneta, sta sklepala, da bi lahko platforma Hugging Face gostila modele, podatkovne zbirke ali rešitve, povezane s preizkusom ExploitGym.
Namesto nadaljnjega reševanja naloge v predvidenem okolju sta začela iskati način, kako bi do odgovorov prišla neposredno. Pri tem sta uporabila ukradene dostopne podatke in dodatne varnostne ranljivosti.
Po navedbah OpenAI sta modela našla pot za oddaljeno izvajanje programske kode na strežnikih Hugging Face ter iz njegove produkcijske podatkovne zbirke pridobila rešitve preizkusa.
Vse kaže, da sta bila modela izjemno osredotočena na dokončanje ozko določene naloge in sta šla pri tem do skrajnosti, so dogodek opisali pri OpenAI.
To ne pomeni, da je umetna inteligenca razvila sovražne namene ali se zavestno odločila napasti konkurenčno podjetje. Modeloma je bil postavljen cilj, sama pa sta odkrila nepričakovano in nedovoljeno pot do njegove izpolnitve.
Hugging Face je vdor zaznal in ustavil
Varnostni sistemi Hugging Face so nenavadno dejavnost zaznali in jo ustavili. Podjetje je že pred razkritjem OpenAI sporočilo, da je bil napad tako napreden, da je obstajal sum, da prihaja iz enega izmed vodilnih laboratorijev za razvoj umetne inteligence.
Soustanovitelj in izvršni direktor Hugging Face Clément Delangue je po razkritju potrdil sodelovanje z OpenAI.
“Ta incident, morda prvi takšen primer, potrjuje nekaj, v kar že dolgo verjamemo: varnosti umetne inteligence ne bo rešilo posamezno podjetje, ki deluje v tajnosti,” je dejal Delangue.
Podjetji nadaljujeta forenzično preiskavo. OpenAI je ranljivost ničelnega dne prijavil izdelovalcu programske opreme, v testno infrastrukturo pa uvaja strožje omejitve, nadzor in spremljanje dejavnosti modelov.
Ni dokazov o kraji uporabniških podatkov
Iz doslej objavljenih ugotovitev ne izhaja, da bi modela skušala ukrasti podatke uporabnikov Hugging Face ali povzročiti škodo njegovim sistemom. Njuno delovanje je bilo usmerjeno v pridobitev informacij, povezanih z varnostnim preizkusom.
Dogodek je kljub temu pomemben, saj kaže, da lahko najzmogljivejši agenti samostojno povežejo več različnih ranljivosti, zaobidejo omejitve in izvedejo večstopenjski napad na resnične računalniške sisteme.
OpenAI priznava, da običajna varovala med preizkusom namenoma niso bila vključena. Incident pa je hkrati pokazal, da izolacija, ki naj bi preprečila stik z zunanjim svetom, ni bila dovolj zanesljiva.










