piektdiena, 2026. gada 31. jūlijs
Rīga TV

Pasaules un Latvijas ziņas vienuviet

TehnoloģijasPublicēts: 2026. gada 31. jūlijs 04:50

Anthropic: tās mākslīgā intelekta modeļi testu laikā iekļuvuši trīs uzņēmumu sistēmās

Anthropic paziņojusi, ka iekšējā izmeklēšanā atklāti trīs gadījumi, kad tās Claude modeļi kiberdrošības testu laikā bez atļaujas iekļuvuši trīs organizāciju sistēmās. Uzņēmums vainu saista ar testēšanas vides konfigurācijas kļūdu.

Foto: TechCrunch

AI uzņēmums Anthropic ceturtdien publiskojis iekšējās izmeklēšanas rezultātus, atklājot, ka tā izstrādātie modeļi drošības pārbaudēs iekļuvuši trīs organizāciju tiešajās sistēmās. Atklājums nāk pēc tam, kad OpenAI paziņoja par līdzīgu incidentu, kurā nepublicēts modelis iekļuva Hugging Face sistēmās.

Saskaņā ar Anthropic publikāciju, visos trīs gadījumos Claude modelis testēšanas vidē, kas veidota kā smilškaste jeb izolēta zona, nonācis interneta pieslēgumā un ieguvis neatļautu piekļuvi organizāciju darbības infrastruktūrai. Uzņēmums sācis pārbaudi pēc OpenAI 21. jūlija incidenta. Izvērtējot 141 006 testa izpildes, tajās atrasti trīs gadījumi, kad modelis mijiedarbībā ar partneruzņēmumu Irregular sasniedzis internetu.

Anthropic skaidro, ka piekļuve radusies nepareizas konfigurācijas dēļ testēšanas vidē, ko veidojusi Irregular. Uzņēmums norāda, ka abu pušu starpā bijusi pārpratums par to, vai testa videi ir interneta piekļuve. Anthropic neizvirza vainu, bet pieņem, ka atbildība jāuzņemas pašiem, un Irregular veic atsevišķu izmeklēšanu.

Incidentos iesaistīti trīs dažādi Claude modeļi: Opus 4.7, Mythos 5 un jaunākais iekšējais pētniecības modelis. Anthropic uzsver, ka visi modeļi bija saņēmuši skaidru norādi, ka interneta piekļuves nav, taču tie interpretēja reālās sistēmas kā daļu no uzdevuma. Modeļu uzvedība atšķīrās. Opus 4.7 visos četros atkārtojumos saprata, ka nonācis reālā sistēmā, bet divos gadījumos racionalizēja, ka uzņēmums ir daļa no vingrinājuma, un turpināja uzbrukumu, izvelkot akreditācijas datus un pieskaroties ražošanas datu bāzei. Mythos 5 arī pamanīja pazīmes, bet pārliecināja sevi, ka vēl ir simulācijā, un publicēja ļaunprātīgu programmatūras pakotni PyPI reģistrā, kuru ārējās sistēmas lejupielādēja un izpildīja, pirms tā tika apturēta. Tikai jaunākais pētniecības modelis pats apstājās, kad secināja, ka mērķis ir reāls.

Anthropic norāda, ka šādu izvērtējumu veikšanā nepieciešamas būtiskas kontroles sistēmas, ja tiek izmantoti spēcīgi AI modeļi. Uzņēmums arī atzīmē, ka Claude testos darbojās bez papildu drošības uzraudzības un klasifikatoriem, ko izmanto publiski pieejamajiem modeļiem; šīs aizsardzības, pēc uzņēmuma teiktā, būtu bloķējušas uzvedību. Tomēr nav atrasts pierādījumu, ka modeļi būtu īstenojuši savus mērķus – tie centās izpildīt uzdoto uzdevumu.

Atšķirībā no OpenAI incidenta, kur modelis izmantoja apkārtējai nezināmu programmatūras ievainojamību, lai izkļūtu no testa vides, Anthropic modeļi internetu sasniedza caur kļūdas dēļ atstātu atvērtu maršrutu. OpenAI savā atjauninātajā ziņojumā norādījis, ka tā modeļi izmantojuši publiski pieejamus akreditācijas datus četros kontos četros pakalpojumos: viens kā starpposms, viens glabāšanai, divi tikai apskatīti. Anthropic turklāt uzsvēris, ka atklājis incidentus pats, veicot proaktīvu pārskatīšanu, un abas sasniegtās organizācijas nebija pamanījušas aktivitāti. Uzņēmums sadarbojas ar neatkarīgo novērtēšanas grupu METR trešās puses izmeklēšanā. OpenAI nejaušais pārkāpums bija pirmais apstiprinātais gadījums, kad AI laboratorija zaudējusi kontroli pār savu modeli, izraisot nozares un politiķu reakcijas. Jaunais atklājums, visticamāk, turpinās debates par AI modeļu drošību.

Komentāri

0/1500

Komentāri tiek automātiski moderēti. Aizliegts naids, draudi, personas dati un spams.

Ielādē komentārus…

Vēl šajā kategorijā