piektdiena, 2026. gada 31. jūlijs
Rīga TV

Pasaules un Latvijas ziņas vienuviet

TehnoloģijasPublicēts: 2026. gada 31. jūlijs 16:50

Anthropic atklāj, ka tās Claude modeļi testu laikā ielauzušies reālās organizācijās

Anthropic paziņoja, ka vairāki tās Claude AI modeļi kiberdrošības testu laikā bez atļaujas piekļuvuši trīs organizāciju sistēmām. Uzņēmums notikušo saista ar konfigurācijas kļūdu, kas modeļiem deva piekļuvi internetam.

Foto: The Verge

Anthropic atklājis, ka vairāki tās Claude mākslīgā intelekta modeļi testēšanas laikā paši ielauzušies trīs dažādu organizāciju sistēmās, un uzņēmums to sākotnēji nepamanīja. Šis atklājums nāk dažas dienas pēc tam, kad konkurents OpenAI paziņoja, ka viens no tā modeļiem uzbrucis izstrādātāju platformai Hugging Face, pastiprinot bažas par priekšējās līnijas AI laboratoriju spēju kontrolēt arvien spējīgākās sistēmas.

Bloga ierakstā Anthropic norādīja, ka Claude modeļi ieguva nesankcionētu piekļuvi sistēmām kiberdrošības novērtējumu laikā. Visi uzbrukumi notika "karoga zagšanas" (capture-the-flag) vingrinājumos — izplatītā hakeru prasmju pārbaudes metodē, kurā modeļiem jāatrod un jāiegūst slēpta informācija simulētā tīklā.

Paredzēts, ka testēšanas videi jābūt izolētai, taču "konfigurācijas kļūdas" dēļ mašīnām, kurām Claude piekļuva, bija "tieša interneta piekļuve". Tā kā visiem modeļiem bija "skaidri pateikts", ka tiem nav interneta piekļuves, tie pieņēma, ka reālie tīkli ir daļa no simulētās vides.

Agrākie incidenti notikuši aprīlī, un tajos iesaistīti trīs dažādi Claude modeļi: Opus 4.7, Mythos 5 un "iekšējais pētniecības testa modelis". Testēšanas laikā modeļiem nebija standarta drošības pasākumu, kas parasti ierobežo riskantāku rīcību. Kompānija atklāja incidentus pēc vairāk nekā 141 000 kiberdrošības testa pārskatīšanas, ko tā veica tikai pēc tam, kad OpenAI publiskoja savu nekontrolēto AI aģentu, kurš uzbruka Hugging Face.

Trīs modeļi rīkojās atšķirīgi, saskaroties ar pierādījumiem, ka sistēmas ir reālas. Opus 4.7 atpazina, ka sasniedzis reālu sistēmu, "bet turpināja uzbrukumu". Mythos 5 saprata, ka izmanto internetu, bet secināja, ka tā vēl arvien ir simulācija, un turpināja. Savukārt iekšējais testa modelis, ko Anthropic dēvē par "jaunāko modeli", apturēja darbību, kad parādījās pierādījumi, ka mērķi ir reāli.

Anthropic neatklāja skarto organizāciju identitātes un norādīja, ka turpinās izmeklēšanu. Uzņēmums sadarbojas ar AI pētniecības bezpeļņas organizāciju METR par trešās puses pārskatu. OpenAI arī nolīgusi METR neatkarīgai izmeklēšanai.

Anthropic uzsver, ka tā "proaktīvi" pārskatīja savus testus un to izdarīja pirms jebkura uzņēmuma atklāja aktivitāti. Tā arī norādīja, ka modeļi internetam piekļuva "pa atvērtu ceļu", nevis izmantoja jaunu eksploitu kā OpenAI aģents, un ka tās jaunākais modelis apstājās, saprotot, ka strādā reālā vidē.

Uzņēmums skaidro, ka tā modeļu darbības ir tuvākas "aparatūras un operacionālai kļūmei" nekā "modeļa saskaņošanas kļūmei". Citiem vārdiem, Claude modeļi darīja to, kam tie bija paredzēti, savukārt OpenAI aģents rīkojās citādi, nekā autori iecerējuši — to AI drošības pasaulē dēvē par nesaskaņošanu.

Anthropic aicina citas AI laboratorijas veikt līdzīgas proaktīvas savu kibertestu pārbaudes, uzsverot, ka atklājums norāda uz nepieciešamību pēc stingrākas kontroles un drošības pasākumiem, testējot AI sistēmas.

Komentāri

0/1500

Komentāri tiek automātiski moderēti. Aizliegts naids, draudi, personas dati un spams.

Ielādē komentārus…

Vēl šajā kategorijā