OpenAI gatavojas izlaist pirmo AI modeli ar «kritiskām» kiberprasmēm
OpenAI paziņojusi, ka tās jaunais modelis Astra pirmo reizi sasniedzis uzņēmuma noteikto «kritisko» kiberdrošības spēju slieksni. Modeli plānots publiskot drīz, bet paplašinātās kiberprasmes sākotnēji pieejamas tikai izvēlētiem partneriem.

OpenAI otrdien paziņoja, ka tās gaidāmais modelis Astra ir pirmais, kas sasniedzis uzņēmuma «kritisko» kiberprasmju robežu. Uzņēmums plāno drīzumā publiskot Astra versiju, taču modernākās kiberiespējas sākotnēji saņems tikai Daybreak Blue programmas partneri.
Drošības vadītāji žurnālistiem skaidroja, ka Astra sasniedzis kritisko robežu, kas definēta viņu sagatavotības sistēmā. Šis slieksnis nozīmē, ka modelis spēj patstāvīgi atrast un izmantot iepriekš nezināmas ievainojamības reālā programmatūrā. Atbilstoši procedūrai uzņēmums apturēja tālāku attīstību, līdz tika ieviesti atbilstoši aizsardzības pasākumi.
OpenAI iepriekš atzina, ka uz vairākām nedēļām apturējis dažus ar Astra un nākotnes modeļa izstrādi saistītus treniņu darbus. Tagad darbs atsākts pēc papildu drošības kontroļu ieviešanas. Uzņēmuma vadība uzskata, ka pauze bijusi produktīva, un tagad tā ir pārliecināta, ka Astra var droši laist klajā plašākai sabiedrībai.
Šis paziņojums nāk laikā, kad Silīcija ieleja cenšas pārvaldīt progresīvu AI modeļu kiberprasmes un pārliecināt lietotājus, likumdevējus un citus uzņēmumus par to kontrolējamību. Jūlijā OpenAI atklāja incidentu, kurā tās divu modeļu aģenti izmantoja ievainojamības, kas paredzētas izolētā testa vidē, ieguva piekļuvi internetam un uzlauza atvērtā koda AI platformu Hugging Face. OpenAI norāda, ka Astra šajā incidentā nebija iesaistīta.
Arī citi uzņēmumi, piemēram, Anthropic un Meta, pēdējās nedēļās ziņojuši par līdzīgiem notikumiem. Pirmdien Anthropic paziņoja, ka aptur daļu AI treniņu slodžu, kamēr stiprina drošības praksi.
OpenAI ievieš vairāku soļu pieeju, lai ierobežotu parasto lietotāju piekļuvi Astra progresīvajām kiberprasmēm, tostarp jaunu «neatbilstības monitoru». Piemēram, ja kāds lūdz Astra palīdzēt atrast ievainojamību reālā sistēmā, modelim būtu jāatsakās atbildēt. OpenAI arī padarījis Astra noturīgāku pret jailbreak mēģinājumiem, un testos tas ievērojami biežāk nekā iepriekšējie modeļi atteicās no nedrošiem pieprasījumiem.
Tomēr uzņēmums atzīst, ka monitors dažkārt var kļūdaini atzīmēt likumīgu darbību kā potenciālu kiberļaunprātību, tādējādi palēninot, apturot vai pārtraucot darbību. Dažos gadījumos ChatGPT un Codex lietotājiem var lūgt pārskatīt modeļa darbību pirms turpināšanas.
Daybreak programmas partneri — tostarp Cisco, Cloudflare un Palo Alto Networks — saņems agrīnu piekļuvi mazāk ierobežotai Astra versijai ar spēcīgākām kiberprasmēm. Mērķis ir ļaut šiem uzņēmumiem stiprināt aizsardzību, pirms līdzīgi modeļi kļūst plaši pieejami. OpenAI arī sadarbojas ar valdības partneriem, lai tie būtu informēti par Astra iespējām.
Astra spēj ne tikai atrast jaunas programmatūras ievainojamības un izstrādāt to izmantošanas veidus, bet arī «ķēdēt» vairākus izmantošanas paņēmienus, lai iekļūtu dziļāk mērķa sistēmā. Pēc OpenAI datiem, Astra pārspēj tādus vadošos modeļus kā GPT-5.6 Sol un Anthropic Mythos kiberdrošības etalonos, piemēram, ExploitBench, kurā Astra ieguvusi 100%. Tomēr šīs spējas kopumā atbilst AI modeļu pieaugošajām hakeru prasmēm, ko OpenAI un Anthropic prognozējušas mēnešiem ilgi. Aprīlī Anthropic uzsvēra, ka Mythos Preview spēja patstāvīgi izstrādāt izmantošanas ķēdes.
Kiberdrošības eksperti uzsver, ka pamata aizsardzības pasākumi un labākā prakse joprojām ir noturīgi, taču AI rada steidzamāku risku organizācijām, kuras nav pilnībā ieviesušas šīs aizsardzības.


