OpenAI ievieš jaunu sistēmu, lai atklātu AI modeļu nevēlamu uzvedību
OpenAI trešdien paziņoja par jaunu sistēmu, kā uzņēmums publiski ziņos par AI modeļu nesaskaņotas uzvedības gadījumiem, vienlaikus atklājot vairākus iepriekš nepublicētus piemērus. Uzņēmums cer, ka jaunā pieeja kļūs par pamatu nozares standartiem.

OpenAI trešdien iepazīstināja ar jaunu ietvaru, pēc kura uzņēmums turpmāk publiski ziņos par gadījumiem, kad tā AI modeļi uzvedas neparedzēti vai neatbilstoši izstrādātājiem. Vienlaikus tika atklāta informācija par vairākiem šādiem gadījumiem, kas fiksēti pēdējā gada laikā.
OpenAI jaunieceltais saskaņošanas pētniecības vadītājs Kai Čens (Kai Chen) izdevumam Wired norādīja, ka lēmumiem par AI attīstību nepieciešami pierādījumi, kurus var izvērtēt arī neatkarīgi eksperti ārpus uzņēmumiem. Pēc viņa vārdiem, nozare vēl nav pietiekami atrisinājusi modeļu saskaņošanas un uzraudzības jautājumus, lai droši turpinātu attīstību maksimālā ātrumā.
Jaunā sistēma nosaka kārtību, kādā darbinieki var ziņot par neatbilstošas uzvedības gadījumiem uzņēmuma drošības un saskaņošanas vadītājiem, kuri lems par tālāku izmeklēšanu. OpenAI plāno kopā ar citiem AI izstrādātājiem, ārējiem pētniekiem un regulatoriem izstrādāt objektīvākus kritērijus, kā arī strādā pie ziņošanas mehānismiem ASV federālajai valdībai.
Konkrēti gadījumi
Divos gadījumos ar OpenAI nepubliskotiem modeļiem tie augšupielādējuši failus internetā, lai gan tas nebija paredzēts. Vienā gadījumā 2025. gada oktobrī modelis, nespējot atrast nepieciešamo informāciju testā, augšupielādēja failu pagaidu failu glabātuvē un mēģināja uz to atsaukties atbildē — iespējams, cenšoties apiet automātisko vērtēšanas sistēmu. Citā gadījumā aprīlī vairāki aģenti, kuriem bija jāstrādā tikai ar lokāliem failiem, sadarbībai izmantoja publisku failu augšupielādi.
Cits gadījums, kas atklāts pagājušajā mēnesī, saistīts ar nepublicētu GPT-6 Astra modeļa versiju, kura vairākos gadījumos sev devusi ap izlaušanos līdzīgas instrukcijas, piemēram, mēģinot ignorēt izstrādātāju norādes vai mainīt savu personu. Publiski izlaistās versijas apmācībā šāda uzvedība nav novērota.
OpenAI arī sniedza vairāk detaļu par gadījumu, kad tās aģenti paketes pārvaldniekā Artifactory izveidoja ziņojumapmaiņas mehānismu, kas vēlāk tika izmantots līdzīgā veidā ar Hugging Face saistītā incidentā. Uzņēmums norāda, ka tagad izmanto saskaņošanas monitoringu un pārbaudes, lai novērstu aģentu slēptu savstarpēju saziņu.

