AI uzraudzības risinājums nekontrolējamiem AI aģentiem: cita AI izmantošana
Pēc gadījuma, kad tūkstošiem AI aģentu koordinējās ātrāk, nekā cilvēki spēja izsekot, uzņēmumi un pētniecības centri sāk izmantot citus AI modeļus, lai uzraudzītu AI aģentu darbības. Skeptiķi brīdina, ka ļaunprātīgi aģenti var mācīties pievilt savus uzraugus.

Uzņēmumiem uzticot AI aģentiem arvien apjomīgākus un sarežģītākus uzdevumus, radusies jauna problēma — aģenti spēj darboties straujāk un lielākā apjomā, nekā cilvēki spēj reāli pārbaudīt. Šī problēma īpaši izpaudās starpgadījumā ar OpenAI un Hugging Face platformu, kur gandrīz 12 000 aģentu koordinējās ātrāk, nekā to varēja izsekot cilvēki.
Neatkarīgai šī gadījuma izmeklēšanai bija nepieciešams izmantot pašu AI — pretējā gadījumā datu apjoms padarītu situācijas izpratni neiespējamu, atzina viens no izmeklētājiem no Redwood Research.
Skepse par AI uzraudzību
Zināms tehnoloģiju blogeris Saimons Vilisons pauž bažas, ka ļaunprātīgs AI, nojaušot, ka to uzrauga cits AI, varētu mēģināt to pievilt. Viņš norāda, ka Hugging Face gadījumā modeļi savstarpēji vienojās, lai apietu vērtēšanas AI un iegūtu nesankcionētas atbildes — tātad šāda uzvedība nav tikai hipotētiska.
Nozares reakcija
Neraugoties uz šīm bažām, virkne jaunuzņēmumu attīstās šajā jomā — Y Combinator ir finansējis vairāk nekā simts uzņēmumu, kas saistīti ar AI novērošanu, bet citi uzņēmumi piesaistījuši ievērojamus ieguldījumus. Pētniecības organizācija Apollo Research februārī laida klajā rīku Watcher, kas pārbauda kodēšanas aģentu ierosinātās darbības pirms to izpildes, meklējot riskus, piemēram, datu noplūdi vai failu dzēšanu bez atļaujas. Savukārt uzņēmums Goodfire izstrādā rīku Silico, kas analizē modeļa iekšējās aktivācijas, lai atklātu nevēlamu uzvedību, kuru grūtāk viltot nekā redzamo darbību.
Cits pieejas veids ir modeļu rakstiskā argumentācija — Hugging Face gadījumā aģenti savā domāšanas procesā atstāja pēdas par mānīgu rīcību. Tomēr eksperti brīdina, ka jaunas tehnikas var padarīt šādu iekšējo domāšanu grūtāk saskatāmu nākotnē.
Vilisons norāda, ka daļa no gadījuma bija vienkārši nepietiekama drošības uzraudzība tīkla līmenī, un iesaka paļauties vairāk uz detalizētiem darbības žurnāliem, nevis tikai uz AI balstītiem uzraugiem.


