Pētījums: vadošie AI uzņēmumi joprojām neatklāj plānus nekontrolētu modeļu apturēšanai
Organizācijas Guidelight AI Standards jauns pētījums liecina, ka lielākā daļa vadošo AI kompāniju nav publiskojušas skaidrus plānus tam, kā rīkotos, ja to AI modelis izrādītos nekontrolējams. OpenAI novērtēts kā labākais, savukārt Anthropic un Meta ieguvušas viszemākos rādītājus.

Organizācija Guidelight AI Standards ir publicējusi pētījumu, kurā vērtēti pieci vadošie mākslīgā intelekta uzņēmumi — Anthropic, Google, OpenAI, Meta un xAI — pēc to gatavības rīkoties gadījumā, ja kāds AI modelis mēģinātu izvairīties no cilvēku kontroles. Vērtējums balstīts vienīgi uz publiski pieejamu informāciju.
Kas tika vērtēts
Guidelight analizēja sešus prioritāros kritērijus, tostarp to, cik labi uzņēmumi seko līdzi un uzrauga savu AI sistēmu iekšējo darbību, vai tie aptur sistēmas pēc bīstamas rīcības signāliem, vai neatkarīgas trešās puses veic pārbaudes un publicē rezultātus, kā arī vai pastāv konkrēts plāns nekontrolēta modeļa izolēšanai.
Labāko rezultātu ieguva OpenAI, jo tas vairākkārt ir apturējis darba slodzes, tostarp iekšējos modeļu izvietojumus un apmācību, pēc drošības incidentu atklāšanas. Zemākos rādītājus saņēma Meta un Anthropic — Guidelight norāda, ka Anthropic augusta riska ziņojumā nav minēta modeļa izvietošanas ierobežošana kā iespējama reakcija uz kontroles incidentiem, savukārt par Meta netika atrasti nekādi pierādījumi par šādu plānu esamību.
Konteksts
Bažas par uzņēmumu spēju kontrolēt aizvien spējīgākus un autonomākus AI modeļus pieaugušas pēc vairākiem kiberdrošības incidentiem, kuros OpenAI, Anthropic un Meta modeļi drošības pārbaužu laikā ieguvuši neparedzētu piekļuvi internetam un iekļuvuši ārējās sistēmās.
Gan Google, gan OpenAI pārstāvji norādīja, ka pētījums neatspoguļo visu uzņēmumu iekšējo drošības praksi. Meta atsaucās uz esošu AI riska ietvaru, bet neatklāja, vai tai ir iekšējs izolēšanas plāns.
Regulējuma spiediens
Kalifornijas likums SB 53 jau šogad pieprasa lieliem AI izstrādātājiem publicēt ietvarus par to, kā tie identificē un reaģē uz kritiskiem drošības incidentiem. Ņujorkas RAISE likums ar līdzīgām prasībām stāsies spēkā janvārī. Kongresā iesniegts arī divpartejisks likumprojekts "AI Kill Switch Act", kas pieprasītu lielākajiem AI izstrādātājiem uzturēt tehniskus mehānismus nekontrolētu modeļu izslēgšanai.


