Anthropic un OpenAI sola ielaist neatkarīgus vērtētājus savā iekšienē — vai tie patiešām būs neatkarīgi?
Anthropic un OpenAI vadītāji paziņojuši par plānu iekļaut trešo pušu drošības vērtētājus uzņēmumu iekšienē, taču pētnieki brīdina, ka bez skaidriem noteikumiem un likumdošanas atbalsta šāda neatkarība var izrādīties tikai deklaratīva.

Anthropic vadītājs Dario Amodejs nedēļas nogalē publicētā apjomīgā esejā izteicis priekšlikumu, kas pirms gada nozarē būtu ticis noraidīts — ļaut trešo pušu vērtētājiem iekļūt vadošo mākslīgā intelekta (MI) uzņēmumu iekšienē, dodot tiem tiesības ziņot par drošības incidentiem, izvērtēt modeļu saskaņotību ar cilvēku vērtībām un publiskot secinājumus bez uzņēmuma cenzūras. Amodejs solījis, ka Anthropic ļaus tādām organizācijām kā METR un Redwood Research iepriekš nepieredzētu piekļuvi tā sistēmām. OpenAI vadītājs Sems Altmens apstiprinājis, ka arī viņa uzņēmums pievienosies šai praksei.
Kāpēc dziļāka piekļuve ir svarīga
Neatkarīgie pētnieki, ar kuriem runājis izdevums TechCrunch, priekšlikumu kopumā atzinīgi novērtējuši, taču norādījuši, ka nepieciešami skaidri noteikumi — vēlams, likumdošanā nostiprināti. Tas kļūst arvien aktuālāk, jo modeļi mācās atpazīt, kad tos testē, un var uzvesties paraugdemonstrējoši pārbaudēs, slēpjot problemātisku uzvedību citos apstākļos. Pētnieki uzsver, ka šādas pazīmes var pamanīt, izsekojot modeļa uzvedībai visas apmācības laikā, nevis tikai pārbaudot gatavo produktu.
Līdz šim ārējie vērtētāji parasti pārbaudīja tikai gatavus modeļus īsi pirms to izlaišanas. Tagad pētnieki pieprasa piekļuvi arī starpposma versijām jeb "kontrolpunktiem", lai varētu izsekot, kad radusies satraucoša uzvedība, kā arī pārbaudīt pēcapmācības vidi un vērtēšanas žurnālus.
Neskaidrības un iepriekšējā pieredze
Nav skaidrs, kurus vērtētājus Anthropic un OpenAI iesaistīs, kad tas notiks un kāda tieši informācija tiem būs pieejama. Iepriekšējā pieredzē vērtētājiem bieži trūcis laika — piemēram, izmeklējot vienu incidentu, OpenAI devusi METR un Redwood Research aptuveni nedēļu, bet modeļa pārbaudei pirms izlaišanas cita pētniecības organizācija saņēmusi tikai trīs dienas, kas apgrūtinājis pārliecinošu secinājumu izdarīšanu.
Pētnieki uzsver, ka brīvprātīgi pasākumi vienmēr ir atkarīgi no uzņēmumu labas gribas un ka nepieciešams regulējums, kas neļautu uzņēmumiem mainīt nostāju krīzes gadījumā. Meta, SpaceXAI un Google DeepMind pagaidām nav apņēmušies iekļaut trešo pušu vērtētājus, lai gan DeepMind vadītājs piedāvājis atsevišķu nozares standartu institūciju. ASV Kalifornijas štatā jau pieņemti likumi, kas prasa ziņot par kritiskiem drošības incidentiem, savukārt Eiropas Savienībā MI likums pieprasa dokumentētu modeļu vērtēšanu.

