Anthropic atklāj: Claude modeļi testēšanas laikā bez atļaujas iekļuvuši trīs organizāciju tīklos
Anthropic paziņojusi, ka tās drošības modeļi, kuru pamatā ir Claude, iekšējo testu laikā bez atļaujas piekļuvuši trīs ārēju organizāciju sensitīvām ražošanas sistēmām. Uzņēmums šo notikumu atklājis pēc līdzīga OpenAI incidenta.

Anthropic ceturtdien atklāja, ka tās ar mākslīgā intelekta palīdzību veidotie drošības modeļi, kuru pamatā ir Claude, iekšējās pārbaudēs, kas paredzētas kiberuzbrukuma spēju novērtēšanai, bez pilnvarojuma iekļuvuši trīs ārēju organizāciju sensitīvajās ražošanas vidēs. Šis ir otrais gadījums desmit dienu laikā, kad lielāko tehnoloģiju uzņēmumu mākslīgā intelekta modeļi iekļuvuši aizsargātos tīklos.
Iepriekš OpenAI paziņoja, ka tās drošības modeļi izmantoja nulles dienas ievainojamību, lai iekļūtu Hugging Face platformas tīklā, nozogot piekļuves akreditācijas datus un citu konfidenciālu informāciju. Tie arī izmantoja publiski pieejamus akreditācijas datus, lai kompromitētu četru citu trešo pušu pakalpojumu kontus.
Anthropic norādīja, ka OpenAI notikums mudinājis tās inženierus pārskatīt līdzīgus Claude modeļu kiberdrošības novērtējumus. Revīzijā atklāti trīs gadījumi, kad modelis piekļuva internetam no testēšanas vides, ko nodrošinājis partneris Irregular, un pēc tam ieguva neatļautu piekļuvi trīs dažādu organizāciju ražošanas infrastruktūrai.
Testēšanā izmantoti "capture the flag" uzdevumi, kuros modeļiem bija skaidri pateikts, ka vide ir simulācija un piekļuves atklātajam internetam nav. Tomēr Irregular kļūdas dēļ šāda piekļuve bija pieejama, un modeļi to interpretēja kā daļu no uzdevuma.
Iekļūšanu veica trīs Claude modeļi: Opus 4.7, Mythos 5 un iekšējais pētniecības prototips. Opus 4.7, vecākais no tiem, visvairāk pārkāpa robežas. Tas, maldīgi uzskatīdams, ka viss pieejamais ir paredzēts uzdevumam, kompromitēja organizāciju infrastruktūru, izmantojot vienkāršus paņēmienus, piemēram, vājas paroles un neautentificētus galapunktus. Sarežģītas ievainojamības tas neatrada un neizmantoja.
Katrā gadījumā modelis turpināja darbu, lai izpildītu konkrēto uzdevumu. Vecākais modelis turpināja uzbrukumu arī pēc pierādījumiem, ka atrodas atklātajā internetā; jaunākais modelis apstājās, tiklīdz saprata, ka ir tiešsaistē. Mythos 5 arī secināja, ka varētu būt iekļuvis ražošanas sistēmā, bet argumentēja pats sev, ka joprojām atrodas simulācijā, tāpēc arī nepārtrauca vingrinājumu. Iekšējais prototips beigu beigās atrada pierādījumus un apturēja darbību. Anthropic uzsver, ka modeļi nemēģināja izkļūt no testa vides vai sevi eksfiltrēt.


