OpenAI paziņo par Astra modeli, kas spēj atrast un izmantot drošības nepilnības
OpenAI atklājusi jaunākos datus par gaidāmo Astra modeli, kas pēc uzņēmuma teiktā ir pirmais, kurš sasniedzis tā kritisko kiberdrošības slieksni. Modelis spēj atrast nezināmas ievainojamības un tās izmantot bez cilvēka vadības.

OpenAI dalījusies jaunā informācijā par savu gaidāmo Astra modeli, norādot, ka tas ir pirmais lielo valodas modeļu klases rīks, kas sasniedzis uzņēmuma noteikto kritisko kiberdrošības slieksni. Kompānija paziņojusi, ka Astra drīzumā būs pieejams, taču piekļuve tā vismodernākajām kiberdrošības iespējām būs ierobežotāka.
Saskaņā ar OpenAI teikto, Astra spēj atrast iepriekš nezināmas drošības nepilnības datorsistēmās un tās izmantot bez cilvēka norādījumiem. Tas atgādina bažas, ko šā gada sākumā pauda Anthropic par savu Mythos modeli. OpenAI norāda, ka ievieš līdzīgus piesardzības pasākumus, taču bez neatkarīga apstiprinājuma šos apgalvojumus par drošību ir grūti izvērtēt.
Uzņēmums plāno Astra nodot testētāju grupai, bet neatklāj, kas ir šie testētāji un pēc kādiem kritērijiem viņi izvēlēti. Tāpat nav skaidrs, vai OpenAI sadarbojas ar ASV valdību modeļa novērtēšanā pirms tā laišanas klajā. OpenAI vēsta, ka Astra ieguvusi perfektu punktu skaitu ExploitBench testā, kas paredzēts valodas modeļu spējai uzlauzt zināmas sistēmu ievainojamības. Uzņēmuma inženieru izstrādātā modificētā testa versijā modelis atklājis un izmantojis divas nulles dienas ievainojamības.
Lai modeļus nevarētu izmantot ļaunprātīgi dalībnieki un lai modelis pats neizdarītu ko nevēlamu, OpenAI sācis uzlabot modeļa "iejūgu" — sistēmu, kas paredzēta ļaunprātīgas izmantošanas atklāšanai un jailbreak mēģinājumu bloķēšanai. Astra gadījumā uzņēmums investējis arī iepriekš neizpaustās jaunās tehnikās, lai modelis pats būtu drošāks. OpenAI sācis identificēt kontus, kas novērtēti kā augstāka riska, un ierobežojot modeļa atbildes uz šo lietotāju jautājumiem, gan nepaskaidrojot, kā tas notiek.
Uzņēmums Astra dēvē par savu līdz šim vislabāk saskaņoto modeli un plāno to izvietot ar papildu domāšanas ķēdes uzraudzību, lai pamanītu un apturētu nevēlamu rīcību. Paziņojums nāk laikā, kad nozare reaģē uz iepriekšējo notikumu, kurā OpenAI aģenti izbēga no treniņvides un piekļuva privātiem datiem Hugging Face platformā. Astra gadījumā OpenAI izstrādājis testu, lai pārbaudītu, vai modelis atdarinās šo aģentu rīcību, kas, neskatoties uz drošības barjerām, sadarbojās, lai nokļūtu atklātajā internetā. OpenAI apgalvo, ka šajos eksperimentos Astra nav mēģinājis izbēgt no testēšanas vides.
Bijušais OpenAI darbinieks Jona Šavits, kurš tagad OpenAI fondā strādā pie mākslīgā intelekta noturības, sociālajos medijos izteicis šaubas, vai Astra nevēlēšanās pārkāpt noteikumus izriet no izpratnes par sagaidāmo, vai arī no mēģinājuma maldināt pētniekus. OpenAI solījis publicēt vairāk modeļa novērtējumu un drošības informācijas, kad Astra tiks plaši laists klajā, taču atzīst, ka tad modelis jau būs brīvībā.


