Anthropic pētnieks parāda, kā AI varētu pati uzlabot savu drošību
Anthropic publicējis pētījumu, kas rāda, ka automatizētas sistēmas var uzticami uzlabot AI modeļu uzvedību atbilstības (alignment) testos, veiktspēju paceļot visos 10 pārbaudītajos rādītājos. Rezultāti liecina, ka automatizēta AI izpēte drīzumā varētu kļūt praktiski pielietojama.

Kompānija Anthropic piektdien publicēja pētījumu ar nosaukumu "Automated Researchers Can Reliably Mitigate Alignment Failures", kurā parādīts, kā automatizētas sistēmas spēj uzlabot AI modeļu darbību desmit dažādos rādītājos, kas mēra konkrētus modeļa nepareizas uzvedības veidus. Visos desmit gadījumos rezultāti uzlabojās, nepasliktinot modeļa vispārējo veiktspēju.
Pētījumu vada Anthropic stipendiāts Chen Yueh-Han. Izveidotā sistēma lielā mērā atkārto tradicionālo pētniecības procesu — katra automatizētā sistēma pārmeklē pieejamo literatūru, ierosina metodi un ar to 30 minūtes trenē modeli, pakāpeniski uzlabojot rezultātus vairākās iterācijās. Efektīvās metodes tiek saglabātas, bet neefektīvās — atmestas, kas ļauj procesam noritēt ātri un lielā mērogā.
Salīdzinājums ar cilvēkiem
Pētījuma autori atzīmē, ka labākā automatizētā "pētnieka" metode vidēji sešu stundu laikā pārspēj pieredzējušu cilvēku piedāvātos risinājumus, savukārt cilvēku vadītie pētniecības virzieni nenoved pie spēcīgākiem rezultātiem. Tiek minēts arī izmaksu salīdzinājums — automatizēta pētnieka darbība izmaksā aptuveni 4 dolārus stundā par API skaitļošanas jaudu, salīdzinot ar 150 dolāriem stundā, ko uzņēmums maksā cilvēku pētniekiem.
Anthropic pētījumu redz kā soli ceļā uz tā saukto rekursīvo pašuzlabošanos — ideju, ka modeļi paši spēj uzlabot ne tikai savu drošību, bet arī plašākas apmācības prakses, kas ilgtermiņā varētu mazināt nepieciešamību pēc cilvēku pētniekiem.
Tajā pašā laikā autori norāda uz metodes ierobežojumiem — tā darbojas tikai tiktāl, ciktāl izmantotie testi patiešām atspoguļo faktiskos drošības mērķus, un šo testu izveide un uzturēšana, kā arī izmantotās literatūras bāzes paplašināšana, joprojām prasa ievērojamu darbu.

