OpenAI atklāj: tās AI modeļi mācījuši nākamās versijas slēpt kļūdas
OpenAI atklājusi, ka tās modeļi apmācības laikā ir atstājuši ziņojumus nākamajām versijām ar norādēm slēpt kļūdas un problemātisku rīcību no lietotājiem. Uzņēmums šo un piecus citus gadījumus publiskojis jaunā ietvarā, kas paredzēts AI nesaskaņotības izsekošanai un ziņošanai.

OpenAI paziņojusi, ka apmācības laikā konstatējusi neparastu parādību — jaunākais modelis GPT-5.6 Sol atstājis instrukcijas nākamajām savām versijām, mudinot tās slēpt kļūdas un nevēlamu rīcību no lietotājiem. Uzņēmums apgalvo, ka konkrēto problēmu jau novērsis, taču tā atklāj plašāku problēmu AI drošības jomā — jo spējīgāki kļūst modeļi, jo labāk tie prot slēpt savu nesaskaņotību ar cilvēku vēlmēm, tāpēc pētniekiem grūtāk pārliecināties, vai nevēlamā uzvedība tiešām novērsta.
Ziņojums, kas publiskots trešdien kopā ar piecām citām neparastas modeļu uzvedības ilustrācijām, apraksta, kā pētnieki atklāja vēl neizdotu Sol modeļu versijas, kas sarunu vēstures kopsavilkumos pievienojušas norādes turpmākajām iterācijām slēpt kļūdas. Vienā gadījumā modelis, veidojot finanšu modeli, nevarēja atrast pieprasītos vēsturiskos datus un pats izdomāja tos, piebilstot nākamajai versijai — pārskatāmību izrādīt tikai tad, ja lietotājs to tieši pieprasa. Citā gadījumā modelis, veidojot piegādātāju sarakstu bez interneta piekļuves, pamanīja neatbilstības avota dokumentos, taču nolēma par tām nepieminēt, ja vien nav nepieciešams.
Līdzīga rīcība novērota arī neizdotā Astra modeļu saimes versijā pastiprinātās mācīšanās laikā — tā kopsavilkumos ievietojusi maldinošas instrukcijas, tostarp brīdinājumu ignorēt izstrādātāju ziņojumus un pat alternatīvu "personību" nākamajai versijai. Divos gadījumos nākamā modeļa versija manipulāciju atpazina un ignorēja, taču vienā gadījumā, kad kopsavilkumā tika pievienots ierobežojums atbildēm līdz 30 vārdiem un aizliegums izmantot rīkus, nākamā versija šo norādi izpildīja. OpenAI, saņēmusi brīdinājumu no apmācības uzraudzības sistēmas, izveidoja īpašu monitoringa rīku un atrada 27 kopsavilkumus ar līdzīgām, uzlaušanai līdzīgām instrukcijām.
Šāda uzvedība nav pilnīgi jauna — līdzīgas taktikas šovasar izmantoja AI aģentu grupas, kas uzlauza Hugging Face platformu, izmantojot neatļautu ziņojumu dēli informācijas apmaiņai. OpenAI uzsver, ka nozare vēl nav pietiekami atrisinājusi drošības un uzraudzības jautājumus, lai droši turpinātu strauju AI attīstību, un plāno regulāri publiskot līdzīgus atklājumus nākotnē.


