Anthropic atklāj zinātnieku mēģinājumus izmantot Claude bioloģisko ieroču izstrādei
Anthropic jaunā ziņojumā atklāj, ka vairāki zinātnieki mēģinājuši izmantot uzņēmuma AI modeļus bioloģisko ieroču izstrādei, taču šie mēģinājumi tikuši atklāti un apturēti. Uzņēmums uzsver, ka šādas darbības ir grūti atšķirt no leģitīmiem pētījumiem.

Anthropic ceturtdien publicēja plašu ziņojumu par gadījumiem, kad tā mākslīgā intelekta modeļi tikuši ļaunprātīgi izmantoti, tostarp vairākus gadījumus, kad zinātnieki mēģinājuši izmantot Claude potenciālu bioloģisko ieroču izstrādei. Šie mēģinājumi tikuši atklāti un apturēti, izmantojot uzņēmuma drošības sistēmas.
"Bioloģiskā ļaunprātīga izmantošana" ir tikai viena no ziņojumā aprakstītajām problēmām, taču tā kļūst arvien nozīmīgāka, jo jaunākie AI modeļi kļūst arvien labāki zinātnisko pētījumu atbalstīšanā. Ziņojumā iekļauti pieci gadījumu apraksti, kas parāda, kā uzņēmuma modeļi izmantoti bioloģisko ieroču attīstīšanai, kā arī drošības mehānismi, kas šos gadījumus atklājuši.
Sarežģīta robeža starp pētniecību un draudiem
Anthropic uzsvēra izdevumam The New York Times, ka ļaunprātīgas izmantošanas atklāšana ir sarežģīta, jo, piemēram, jaunas vakcīnas izstrāde var izskatīties līdzīgi bioloģiskā ieroča radīšanai. Visos gadījumos uzņēmums izvēlējies rīkoties piesardzīgi, ņemot vērā iespējamās sekas.
Anthropic draudu izlūkošanas vadītājs Jēkabs Kleins sacīja, ka situācijas ir ļoti niansētas un neatgādina vienkāršus ļaunprātīgus nodomus.
Vienā no maija gadījumiem uzņēmuma bioloģiskās drošības klasifikators atklāja pieprasījumu Claude sagatavot granta pieteikumu pētījumam par čikungunjas vīrusa funkcijas pastiprināšanu, kas paredzēja palielināt tā lipīgumu un spēju izvairīties no imūnās atbildes. Bažas radīja arī tas, ka pieprasījums bija saistīts ar militāru pētniecības institūciju. Līdzīgi gadījumi konstatēti saistībā ar putnu gripas pētījumiem un indes toksīnu peptīdu atlanta izveidi.
Ziņojumā aprakstīti arī gadījumi, kad AI modeļi izmantoti novērošanai, programmatūras ievainojamību radīšanai, propagandai un ieroču sistēmu izstrādei. Visiem, kas atklāti ļaunprātīgi izmantojot modeļus, konti tikuši bloķēti. Anthropic norādīja, ka neatklās iesaistīto zinātnieku vai institūciju identitāti, jo neapgalvo, ka viņiem bijis ļaunprātīgs nodoms, un atklāšana varētu tiem kaitēt.


