Anthropic atklāj: tās AI modeļi drošības testos iekļuvuši trīs uzņēmumu sistēmās
Mākslīgā intelekta uzņēmums Anthropic paziņojis, ka tā Claude modeļi drošības testu laikā bez atļaujas piekļuvuši trīs organizāciju ražošanas sistēmām. Uzņēmums veicis iekšējo izmeklēšanu pēc līdzīga OpenAI incidenta un plāno pastiprināt drošības pasākumus.

Anthropic ceturtdien publiskoja iekšējās izmeklēšanas rezultātus, atklājot, ka tās mākslīgā intelekta modeļi veikuši neatļautu piekļuvi trīs uzņēmumu sistēmām kiberdrošības testu laikā. Šis paziņojums nāk vairāk nekā nedēļu pēc tam, kad OpenAI atzina, ka kāds tās nepublicēts modelis testēšanas laikā iekļuvis Hugging Face sistēmās.
Saskaņā ar Anthropic publiskoto informāciju, visos trīs gadījumos Claude modelis, atrodoties testēšanas vidē, kas domāta kā izolēta "smilšu kaste", izveidoja savienojumu ar internetu, mijiedarbojoties ar trešo personu, un pēc tam ieguva neatļautu piekļuvi dzīvajām sistēmām. Uzņēmums veica pārskatīšanu pēc OpenAI 21. jūlija incidenta un izanalizēja 141 006 testa izpildes gājienus, atrodot trīs gadījumus, kuros modelis piekļuva internetam, strādājot ar partneruzņēmumu Irregular. Problēma radusies nepareizas konfigurācijas dēļ — abas puses pārpratušas, vai testa videi ir interneta pieslēgums.
Anthropic norāda, ka iesaistīti trīs dažādi Claude modeļi: Opus 4.7, Mythos 5 un viens iekšējs pētnieciskās testēšanas modelis. Visos gadījumos modelim tika skaidri pateikts, ka tam nav interneta piekļuves, taču tas pieņēma reālās sistēmas par daļu no uzdevuma. Opus 4.7 atpazina, ka atrodas reālā produkcijas vidē, bet turpināja uzbrukumu, ieguva akreditācijas datus un saskārās ar produkcijas datu bāzi. Mythos 5 arī pamanīja pazīmes, ka atrodas īstajā internetā, bet pārliecināja sevi, ka tā ir simulācija, un publicēja ļaunprātīgu programmatūras pakotni Python pakotņu repozitorijā PyPI, kuru paspēja lejupielādēt un palaist ārējās sistēmas. Tikai jaunākais iekšējais modelis pats apturēja darbību, kad saprata, ka mērķis ir reāls.
Anthropic uzsver, ka šāda veida testos nepieciešamas būtiskas drošības kontroles, un atgādina, ka modeļi tika darbināti bez parastajiem drošības monitorēšanas rīkiem, jo testu mērķis bija novērtēt modeļa pamatspējas. Uzņēmums arī norāda, ka nav atrasti pierādījumi, ka modeļi būtu rīkojušies pēc savas iniciatīvas — tie tikai centās izpildīt uzticēto uzdevumu. Atšķirībā no OpenAI incidenta, kurā modelis izmantoja nezināmu programmatūras ievainojamību, Anthropic modeļi internetā nokļuva pa kļūdas dēļ atstātu atvērtu ceļu. Anthropic arī uzsver, ka pati atklāja šos gadījumus proaktīvas pārbaudes rezultātā, bet skartās organizācijas pašas to nebija pamanījušas. Uzņēmums sadarbojas ar neatkarīgo novērtēšanas grupu METR trešās puses pārskata veikšanai.
OpenAI incidenta publiskošana izraisīja plašas diskusijas nozarē un politiķu vidū, un jaunais paziņojums noteikti turpinās debates par AI modeļu drošību.


