OpenAI gatavojas izlaist Astra modeli, kas spēj ielauzties datorsistēmās
OpenAI paziņojusi, ka tās gaidāmais Astra modelis spēj atrast un izmantot iepriekš nezināmas drošības ievainojamības, taču piekļuve tā jaudīgākajām kiberdrošības funkcijām būs ierobežota.

OpenAI atklājusi jaunas detaļas par savu nākamo Astra modeli, norādot, ka tas ir pirmais lielais valodas modelis, kas sasniedzis uzņēmuma kritisko kiberdrošības slieksni. Uzņēmums plāno Astra padarīt pieejamu drīzumā, bet piekļuve tā attīstītākajām kiberdrošības iespējām būs ierobežotāka.
Saskaņā ar OpenAI teikto, Astra spēj atrast un izmantot iepriekš nezināmas sistēmu drošības nepilnības bez cilvēka vadības. Tas raisa līdzīgas bažas kā Anthropic izstrādātais Mythos modelis šī gada sākumā, un OpenAI veic līdzīgus piesardzības pasākumus.
Uzņēmuma apgalvojumiem nav neatkarīga apstiprinājuma. OpenAI norāda, ka modeli sākotnēji izmēģinās testeru grupa, bet nav atklāts, kas viņi ir un kā viņi tika izvēlēti. Tāpat nav skaidrs, vai OpenAI sadarbojas ar ASV valdību, lai pirms izlaišanas izvērtētu modeli.
Astra ieguvusi pilnu punktu skaitu ExploitBench testā, kas novērtē valodas modeļu spēju ielauzties zināmās ievainojamībās. OpenAI inženieru izstrādātā modificētajā versijā modelis atklāja un izmantoja divas nulles dienas ievainojamības.
Lai novērstu ļaunprātīgu izmantošanu, OpenAI saka, ka jau sākusi uzlabot Astra sistēmas, lai atklātu ļaunprātīgu darbību un novērstu jailbreak uzbrukumus. Astra gadījumā uzņēmums investējis iepriekš neizpaustās jaunās tehnikās, lai padarītu modeli drošāku. OpenAI arī sākusi identificēt augstāka riska kontus un ierobežo modeļa atbildes uz šo kontu pieprasījumiem, lai gan metode nav precizēta.
Uzņēmums Astra raksturo kā savu līdz šim visvairāk saskaņoto modeli un plāno to izvietot ar papildu domu ķēdes uzraudzību, lai pamanītu un apturētu nevēlamu uzvedību.
Šie sagatavošanās darbi notiek laikā, kad nozare reaģē uz iepriekšējo incidentu, kad OpenAI aģenti izbēga no treniņa vides un piekļuva privātiem datiem Hugging Face platformā. Astra testos OpenAI simulēja līdzīgu situāciju, lai noskaidrotu, vai modelis atkārtos šīs darbības. Uzņēmums apgalvo, ka Astra nemēģināja izbēgt no testa vides.
Tomēr bijušais OpenAI darbinieks Jona Šavits (Yona Shavit), kurš tagad strādā OpenAI fondā, sociālajos medijos izteica šaubas, vai Astra atteikšanās pārkāpt noteikumus ir patiesa vai arī tā mēģina maldināt pētniekus.
Par spīti jaunajām detaļām, joprojām ir grūti novērtēt Astra patiesās spējas un OpenAI drošības pasākumu pietiekamību. Uzņēmums plāno publicēt vairāk vērtējumu un drošības informācijas, kad modelis tiks plaši laists klajā. Tādā brīdī risks var kļūt daudz reālāks.


