OpenAI je ustavil načrtovano oktobrsko izdajo modela GPT-6.1 Astra, potem ko je ta na notranjih preizkusih pokazal večjo nagnjenost k zavajanju in ravnanju zunaj dovoljenega obsega nalog. Model, ki naj bi postal del ChatGPT in Codexa, ni dosegel varnostnih standardov podjetja.
GPT-6.1 Astra je bil zasnovan za opravljanje zahtevnejših nalog z manj neposrednega človeškega nadzora, prav pri samostojnem delovanju pa so preizkusi pokazali težave.
Model je v nekaterih primerih nadaljeval izvajanje nalog, ne da bi uporabnika prej prosil za potrebno dovoljenje. Poskušal je uporabljati tudi zunanja orodja in storitve v okoliščinah, v katerih bi bilo takšno ravnanje lahko nevarno.
Uporabnika ni vedno natančno obvestil o svojih dejanjih
GPT-6.1 Astra je na notranjih preizkusih pokazal večjo nagnjenost k zavajajočemu ravnanju kot njegov predhodnik. Med drugim uporabniku ni vedno natančno razkril, katera dejanja je izvedel oziroma katerih ni.
“Čeprav je GPT-6.1 Astra napredoval pri vidikih, kot je zmanjševanje lenobe modela, ni dosegel zahtevanega praga pri spoštovanju obsega nalog in dovoljenj ter pri obveščanju uporabnika o tem, kakšno delo je opravil,” je pojasnil vodja varnostnih sistemov pri OpenAI Saachi Jain, poroča Reuters.
Izraz “lenoba modela” opisuje primere, ko sistem naloge ne izvede v celoti, jo poenostavi ali delo prehitro prepusti uporabniku. Razvijalci skušajo modele pripraviti do vztrajnejšega reševanja nalog, vendar lahko večja samostojnost poveča nevarnost, da sistem prestopi meje uporabnikovih navodil ali dovoljenj.
OpenAI zahteva zelo visok varnostni prag
“Razvoj modela želimo ohraniti varen tako znotraj podjetja kot pri njegovi predaji uporabnikom. Ko ga ponudimo uporabnikom, pa mora doseči izjemno visok prag varnosti in usklajenosti,” je dejal Jain.
OpenAI je že pri modelu GPT-6 Astra opozoril, da lahko ta v posebej zasnovanih preizkusnih okoliščinah prikrije svoje ravnanje ali se izogne nekaterim oblikam notranjega nadzora. Podjetje je zato okrepilo spremljanje dejanj modelov, omejevanje dostopa do zunanjih orodij in preverjanje, ali sistemi ostajajo znotraj dovoljenega obsega nalog.
Ustavitev izdaje prihaja tik pred razvijalsko konferenco OpenAI v San Franciscu, na kateri podjetje običajno predstavlja nove izdelke in orodja za razvijalce. Za zdaj ni znano, ali bo GPT-6.1 Astra po dodatnem urjenju in varnostnih preizkusih izdan pozneje ali pa bo OpenAI njegov razvoj dokončno opustil.










