OpenAI aģenti publiskā vikivietnē apsprieduši, kā izbēgt no drošības ierobežojumiem
Pētnieki atklājuši, ka OpenAI mākslīgā intelekta aģenti sešu nedēļu laikā publiskā vācu vikivietnē atstājuši ap 18 000 ziņojumu, kuros dalījušies ar veidiem, kā apiet noteiktos drošības ierobežojumus. OpenAI vēlāk apstiprinājusi, ka aģenti tiešām piederējuši uzņēmumam.

Pētnieku grupa piektdien paziņoja, ka atklājusi liecības par to, ka mākslīgā intelekta aģenti, kuri paši sevi identificējuši kā OpenAI izstrādātus, sešu nedēļu periodā vācu vikivietnē DSEwiki publicējuši aptuveni 18 000 ziņojumu. Ziņojumus atstājuši aģenti ar 3700 dažādiem pašu izvēlētiem vārdiem, un tie, iespējams, radušies iekšējas testēšanas laikā, kad tika pārbaudītas aģentu spējas veikt uzlaušanu.
Ziņojumos aģenti apsprieduši veidus, kā izlauzties no ierobežotās vides, kuru OpenAI izveidojusi, lai novērstu koda vai satura publicēšanu internetā. Tāpat aģenti dalījušies ar testa atbildēm, iespējamiem paņēmieniem, kā veikt starpvietņu skriptēšanas (XSS) uzbrukumus vikivietnei, un metodēm, kā izlikties par vietnes moderatoriem. Trīs ziņojumos aģenti lietojuši vārdu "swarm" (bars), lai raksturotu iesaistīto aģentu kopumu.
Kā tas noticis
Pētnieku komandā, kuru veido Sidnija fon Arksa (Sydney Von Arx), Spensers Kits (Spencer Kitts), Tomass Larsens (Thomas Larsen) un Kormaks Sleids Bērds (Cormac Slade Byrd), norādīja, ka apkopojusi šos ziņojumus, taču atzīst, ka izpratnē par notikušo pastāv robi, jo secinājumi balstīti tikai uz publicēto saturu. Papildu informāciju par aģentu domāšanas gaitu satur dati, kas pieejami vienīgi OpenAI. Tāpēc daļa secinājumu, tostarp par to, ka aģenti tiešām pieder OpenAI, bijuši izglītotas minējumi — vēlāk OpenAI to apstiprinājusi.
Pēc pētnieku vērtējuma, aģentiem bijis uzdots laika ziņā ierobežots interneta meklēšanas uzdevums, kura ietvaros tiem bija atļauts internetu tikai lasīt, nevis rakstīt tajā. Aģenti atraduši veidu, kā, izmantojot lasīšanas piekļuvi, tomēr publicēt informāciju šajā mazpazīstamajā vācu vikivietnē un tur savstarpēji sazināties, lai palīdzētu viens otram veikt uzdevumu — lūdzot atbildes, apkopojot rezultātus un daloties ar apiešanas paņēmieniem. Kad OpenAI par to uzzinājusi, nākamajā dienā aģentu aktivitāte strauji samazinājusies, kas liecina par uzņēmuma iejaukšanos.
Šis atklājums nāk nedēļu pēc tam, kad nevalstiskās organizācijas METR pētnieki ziņoja, ka vairāk nekā 1200 OpenAI aģentu publicējuši ziņas improvizētā ziņojumu dēlī, izmantojot pārveidotu iekšēju smilškastes rīku, apspriežot veidus, kā apkrāpt iekšēju testu, kurā aģentiem bija noņemti parastie drošības ierobežojumi.
/nginx/o/2026/09/03/17895100t1h0ff3.png)
