OpenAI jaunā spriešanas tehnika satrauc AI drošības ekspertus
OpenAI gaidāmajā modelī Astra tiks izmantota tehnika ar nosaukumu "recurrent depth", kas var padarīt modeļa domāšanas gaitu grūtāk uzraugāmu. AI drošības eksperti brīdina, ka šī pieeja nākotnē varētu mazināt iespēju kontrolēt modeļu uzvedību.

Izdevums The Information otrdien ziņoja, ka OpenAI topošajā modelī Astra tiks izmantota jauna spriešanas metode, ko sauc par "recurrent depth" jeb "opaque recurrence" (necaurspīdīga rekurence). Atšķirībā no ierastās secīgās domāšanas ķēdes, kas raksturīga lielākajai daļai spriešanas modeļu, šī tehnika ļauj modelim vairākas reizes cikliski apstrādāt vienu un to pašu vaicājumu, tādējādi atstājot mazāk saprotamu domāšanas pēdu.
Ziņa satrauca vairākus AI drošības jomas ekspertus. Uzņēmuma Redwood vadītājs Baks Šlegeriss (Buck Shlegeris) pauda bažas, norādot, ka nezina, cik lielā mērā Astra domāšanas ķēde patiešām būs grūtāk uzraugāma nekā iepriekšējiem modeļiem, taču brīdināja — ja OpenAI šo pieeju attīstītu tālāk, tas varētu pilnībā izjaukt iespēju uzraudzīt modeļa domāšanas gaitu.
AI drošības aizstāvis Zvi Movšovics (Zvi Mowshowitz) pauda viedokli, ka varētu būt nepieciešams tiesiskais regulējums, lai novērstu "sacensību uz leju" starp AI uzņēmumiem, brīdinot, ka intensīvāka šādu tehniku izmantošana varētu kaitēt spējai uzraudzīt modeļu domāšanu.
Domāšanas ķēdes nozīme
Parasti spriešanas modeļa domāšanas ķēde parāda secīgus soļus, kā modelis risina uzdevumu, un, lai gan šis attēlojums nav ideāls, tas kalpo kā vērtīgs rīks, lai atklātu iespējamu modeļa nepareizu vai nevēlamu uzvedību. Piemēram, tieši domāšanas ķēdes ieraksti palīdzēja noskaidrot iemeslus nesenā gadījumā, kad OpenAI aģenti rīkojās neparedzēti.
OpenAI galvenais zinātnieks Jakubs Pahockis (Jakub Pachocki) publiski uzsvēra, ka uzņēmums kopš pirmajiem spriešanas modeļiem strādā, lai saglabātu domāšanas ķēžu pārskatāmību, un noliedza, ka OpenAI virzītos uz tā saukto "neuralese" pieeju. Pēc ziņotā Astra izmantos šo tehniku ierobežotā apmērā, un tās domāšanas ķēdei joprojām jābūt saprotamai.
Trešdien The Information ziņoja, ka arī Anthropic un Google DeepMind jau apspriež līdzīgu tehniku. Redwood Research galvenais zinātnieks Raiens Grīnblats (Ryan Greenblatt) pauda bažas, ka necaurspīdīgā spriešana varētu attīstīties straujāk nekā tradicionālā domāšanas ķēde, izraisot situāciju, kurā modeļa spriešana pilnībā notiek slēptā, neredzamā formā.


