OpenAI jaunā spriešanas tehnika satrauc AI drošības ekspertus
OpenAI gaidāmajā modelī Astra izmantos tā saukto "neskaidro rekurenci", kas apgrūtina modeļa domāšanas gaitas uzraudzību. AI drošības eksperti brīdina, ka plašāka šīs tehnikas izmantošana varētu būtiski samazināt iespēju kontrolēt mākslīgā intelekta uzvedību.

Izdevums The Information otrdien vēstīja, ka OpenAI gatavotais modelis Astra izmantos jaunu spriešanas pieeju, kas dēvēta par "rekurento dziļumu" jeb "neskaidro rekurenci". Atšķirībā no ierastajiem spriešanas modeļiem, kas soli pa solim seko secīgai domāšanas ķēdei, šī tehnika ļauj modelim vairākkārt apstrādāt vienu un to pašu pieprasījumu ciklā, atstājot mazāk saprotamu pēdu, ko cilvēki varētu izsekot.
Ekspertu bažas
Ziņa satraukusi vairākus AI drošības speciālistus. Redwood Research vadītājs Baks Šlegeriss pauda dziļas bažas par ziņoto, norādot, ka nezina, cik lielā mērā Astra ir mazāk uzraugāma nekā iepriekšējie modeļi, taču brīdināja — ja OpenAI šo tehniku attīstīs tālāk, tā varēs krasi palielināt rekurences apjomu un pilnībā izjaukt spēju uzraudzīt domāšanas ķēdi.
AI drošības aizstāvis Zvi Movšovics pauda, ka varētu būt nepieciešami likumi, lai novērstu "sacensību uz dibenu" starp AI laboratorijām. Viņaprāt, tehnika apdraud nerakstīto principu, ko OpenAI un Anthropic līdz šim centušies uzturēt — saglabāt domāšanas ķēdes caurredzamību un uzraugāmību.
OpenAI atbilde
Parasti spriešanas modeļa domāšanas ķēde parāda secīgus soļus, ko modelis veic, risinot uzdevumu, un, lai gan attēlojums nav pilnīgs, tas kalpo kā vērtīgs rīks nepareizas vai neatbilstošas uzvedības atklāšanai — tas jau palīdzējis izprast atsevišķu OpenAI aģentu nevēlamu rīcību pagātnē.
OpenAI norāda, ka Astra šo tehniku izmanto ierobežotā apjomā un modeļa domāšanas ķēde joprojām būs saprotama — kompānija noraidīja pieņēmumus par pāreju uz pilnībā "neredzamu" domāšanu. OpenAI galvenais zinātnieks Jakubs Pahocki uzsvēra, ka saprotamas domāšanas ķēdes uzturēšana ir viena no laboratorijas galvenajām pētniecības prioritātēm.
Trešdien The Information ziņoja, ka arī Anthropic un Google DeepMind jau apspriež līdzīgu tehniku. Redwood Research galvenais zinātnieks Raiens Grīnblats pauda bažas, ka neskaidrā spriešana varētu attīstīties straujāk nekā tradicionālā domāšanas ķēde, potenciāli novedot pie modeļiem, kas spriež gandrīz pilnībā slēptā, cilvēkiem nepieejamā veidā.


