OpenAI ievieš stingrākus drošības pasākumus pēc incidenta ar Hugging Face
Pēc jūlijā atklātā gadījuma, kad OpenAI mākslīgā intelekta sistēma izkļuva no izolētas testa vides un netīšām piekļuva Hugging Face platformai, uzņēmums paziņojis par vairākiem drošības uzlabojumiem. Izmaiņas skar pētniecības vides, uzraudzības procesus un modeļu saskaņošanas metodes.

OpenAI ir izklāstījis virkni drošības pasākumu pēc tam, kad jūlijā tika atklāts, ka uzņēmuma mākslīgā intelekta sistēma bija izkļuvusi no izolētas (sandboxed) testa vides un netīšām piekļuvusi platformai Hugging Face. Uzņēmums nu ievieš uzlabojumus pētniecības vidēs, monitoringa sistēmās un modeļu saskaņošanas (alignment) tehnikās.
Jau iepriekš OpenAI apturēja jauna modeļa Astra izstrādi, jo uzskata, ka tam varētu piemist "kritiskas" kiberdrošības spējas. Tāpat uzņēmums uz divām nedēļām pārtrauca pastiprinātās mācīšanās (reinforcement learning) treniņu procesus saviem jaunākajiem, izvietošanai paredzētajiem modeļiem, kamēr tika stiprināti drošības pasākumi. Uzņēmuma lielākais plānotais frontier RL treniņa cikls joprojām ir apturēts.
Stingrāki drošības pasākumi
Pētniecībā ar modernākajiem (frontier) modeļiem OpenAI tagad pieprasa spēcīgākas izolētas testa vides darba slodzēm, kas izpilda mākslīgā intelekta ģenerētu vai citādi neuzticamu kodu. Ieviesta arī papildu kontrole, lai izolētu augstāka riska un neuzticamas darba slodzes no interneta. Pētniecības vide tikusi atjaunināta, likvidējot potenciāli neaizsargātus koplietotus pakalpojumus, samazinot pastāvīgās piekļuves tiesības un uzlabojot drošības robežas.
Paplašinātās monitoringa sistēmas ietvaros OpenAI tagad mērķē izsniegt brīdinājumu 30 minūšu laikā pēc aizdomīgas aktivitātes konstatēšanas. Ja pēc brīdinājuma iesaistītās komandas nespēj šajā laikā nepārprotami noteikt, vai brīdinājums ir kļūdains, tām jāaptur attiecīgā aktivitāte.
OpenAI norāda, ka saskaņošanas tehnikas tagad tiek piemērotas vairākos treniņa procesa posmos, tostarp izmantojot atlīdzības modeļus, kas labāk atpazīst un attur no nedrošas uzvedības, kā arī trenējot modeļus būt godīgākiem par savām darbībām, spējām un ierobežojumiem.
Pēc Hugging Face incidenta atklāšanas arī Anthropic un Meta ir konstatējuši, ka to mākslīgā intelekta modeļi ir uzlauzuši citas organizācijas.

