Anthropic pētnieks demonstrē AI sistēmu, kas pati uzlabo modeļu saskaņotību
Anthropic publicējis pētījumu par automatizētu sistēmu, kas spēj konsekventi uzlabot AI modeļu izturēšanos saskaņotības testos, neizraisot vispārējās veiktspējas kritumu. Rezultāti tiek uzskatīti par soli ceļā uz AI, kas spēj pati sevi trenēt un uzlabot.

Anthropic pētnieku programmas dalībnieks piektdien publicējis pētījumu ar nosaukumu "Automated Researchers Can Reliably Mitigate Alignment Failures", kurā aprakstīta automatizēta sistēma AI modeļu saskaņotības uzlabošanai. Pētījumu vadījis Anthropic pētnieks Čens Jueханs (Chen Yueh-Han).
Sistēma tika testēta uz desmit dažādiem etaloniem (benchmarks), kas katrs mēra kādu konkrētu nesaskaņotas uzvedības veidu. Automatizētā sistēma spēja uzlabot rezultātus visos desmit gadījumos, nesamazinot modeļa vispārējo veiktspēju.
Kā darbojas process
Sistēma lielā mērā atkārto tradicionālu pētniecības pieeju — tā meklē pieejamo literatūru, izvirza metodi un trenē modeli ar šo metodi apmēram 30 minūtes, pakāpeniski uzlabojot rezultātus vairākās iterācijās. Efektīvās metodes tiek saglabātas, bet neefektīvās — atmestas, kas ļauj sistēmai darboties ātri un lielā mērogā.
Pētījuma autori raksta, ka rezultāti sniedz agrīnus pierādījumus tam, ka automatizēta saskaņotības apmācība varētu kļūt praktiski izmantojama tuvākajā laikā. Tas tiek uzskatīts par soli ceļā uz tā saukto rekursīvo pašuzlabošanos — ideju, ka AI modeļi varētu paši uzlabot savu apmācības procesu.
Salīdzinājums ar cilvēkiem
Pētījumā tiek tieši salīdzināta automatizētā saskaņotības pētnieka (AAR) veiktspēja ar cilvēku darbu. Autori norāda, ka labākā AAR metode vidēji sešu stundu laikā pārspēj to, ko piedāvā pieredzējuši cilvēki pētnieki, un ka cilvēku vadītie pētniecības virzieni nenoved pie spēcīgākiem rezultātiem.
Pētījumā minēta arī izmaksu atšķirība — automatizēta pētnieka darbība izmaksā aptuveni 4 dolārus stundā par API skaitļošanas resursiem, salīdzinot ar 150 dolāriem stundā, ko uzņēmums maksā cilvēku pētniekiem.
Tomēr autori atzīst arī ierobežojumus — sistēma darbojas tikai tiktāl, cik precīzi izmantotie etaloni atspoguļo reālos saskaņotības mērķus, un joprojām nepieciešams ievērojams darbs, lai šos etalonus izveidotu, uzturētu un paplašinātu literatūras bāzi, no kuras automatizētie pētnieki smeļas informāciju.

