trešdiena, 2026. gada 29. jūlijs
Rīga TV

Pasaules un Latvijas ziņas vienuviet

TehnoloģijasPublicēts: 2026. gada 29. jūlijs 21:50

Dažus jaudīgākos AI modeļus ir satraucoši viegli uzlauzt

FAR.AI pētījums atklāj, ka daži vadošie mākslīgā intelekta modeļi ir viegli apietami, apejot drošības barjeras, īpaši SpaceXAI Grok modelis.

Foto: Wired

Bezpeļņas organizācija FAR.AI, kas nodarbojas ar AI drošību, ir publicējusi ziņojumu, kurā testēti populārākie ASV uzņēmumu radītie mākslīgā intelekta modeļi. Pētījumā tika izmantots rīks, kas automātiski ģenerē tūkstošiem problemātisku uzvedņu, lai noteiktu, cik viegli modeļus var piespiest pārkāpt to drošības ierobežojumus.

Rezultāti liecina, ka visneaizsargātākais bija SpaceXAI (apvienotais uzņēmums) Grok modelis, kuram tika atrasti 448 uzlaušanas veidi. Tam seko Google Gemini ar 249 atrastiem uzlaušanas veidiem. Savukārt Anthropic modeļi Claude un Fable, kā arī OpenAI GPT modeļi izrādījās imūni pret šiem uzbrukumiem. Tomēr FAR.AI brīdina, ka tas nenozīmē, ka šie modeļi ir pilnīgi droši pret sarežģītākiem uzlaušanas paņēmieniem.

Pētījums arī aprēķināja, cik lēti ir likt modeļiem uzvesties nevēlami. Lai uzlauztu Grok, izmaksas bija tikai 58 dolāri, savukārt Gemini uzlaušana izmaksāja 278 dolārus. FAR.AI izpilddirektors Adams Glīvs uzsver, ka AI modeļi pašlaik ir mazāk regulēti nekā restorāni, un tas pierāda nepieciešamību pēc ārējiem standartiem un regulējuma. Viņš norāda, ka paļaušanās uz brīvprātīgām saistībām ir bezjēdzīga.

Google DeepMind pārstāvis Rohins Šāhs norādīja, ka ziņojumu nevajadzētu uzskatīt par visaptverošu Gemini drošības novērtējumu, jo ne visi uzlaušanas veidi ir vienlīdz nopietni. Anthropic pārstāvis Maikls Acimens apstiprināja, ka viņi nepārtraukti uzlabo savas drošības sistēmas, savukārt OpenAI un SpaceXAI uz komentāru pieprasījumu neatbildēja.

Vairākos ASV štatos, piemēram, Kalifornijā un Ņujorkā, jau ir pieņemti likumi, kas prasa AI izstrādātājiem publicēt drošības ziņojumus. Jūnijā Trampa administrācija ieviesa eksporta ierobežojumus Anthropic modeļiem, atsaucoties uz nacionālās drošības bažām. Hārvarda universitātes datorzinātnieks Stīvens Kaspers brīdina, ka AI pētniecības sabiedrībā valda drūmas prognozes par iespējamiem nopietniem incidentiem bioloģijas, kiberdrošības vai ķīmijas jomā tuvāko mēnešu laikā.

Stenfordas universitātes pētniece Anka Roila uzsver, ka Anthropic un OpenAI izmantotajiem drošības pasākumiem vajadzētu būt par standartu visiem modeļiem, un jautājums ir par to, kāpēc daži uzņēmumi tos ievieš, bet citi ne.

Komentāri

0/1500

Komentāri tiek automātiski moderēti. Aizliegts naids, draudi, personas dati un spams.

Ielādē komentārus…

Vēl šajā kategorijā