Nvidia pētījums: mākslīgā intelekta rezultātus nosaka nevis modelis, bet apkārtējā sistēma
Nvidia pētnieki atklāja, ka ar pareizu palīgsistēmu ap AI modeli Claude Opus 5 sarežģītā spēļu testā sasniedza 100% rezultātu, savukārt bez tās — vien 30%. Tas liecina, ka tā sauktais „harness” var būt svarīgāks par pašu modeli.

Nvidia piektdien publicēja pētījumu, kas rāda — ilgtermiņa uzdevumos AI aģenta veiktspēju vairāk nosaka nevis pats valodas modelis, bet tam apkārt izveidotā sistēma jeb „harness”. Izmantojot pielāgotu risinājumu, kas uzlabo modeļa atmiņas apstrādi un ietver papildu "uzrauga" komponenti, pētnieki panāca, ka modelis Claude Opus 5 sasniedza 100% rezultātu testā ARC-AGI-3. Šis tests pārbauda spēju spēlēt un uzvarēt vienkāršās divdimensiju spēlēs bez iepriekšējām instrukcijām, un to uzskata par sarežģītu pat vadošajiem AI modeļiem. Bez minētās papildu sistēmas tas pats modelis uzrādīja tikai 30% — kas gan bija labākais rezultāts starp visiem testētajiem modeļiem.
Nvidia produkta jomas viceprezidents Adels Els Halaks skaidroja, ka aģents nav vienkārši modeļa saskarne, bet gan modelis kopā ar apkārt izveidoto rīku, izpildvides un prasmju kopumu. Īpaši nozīmīga izrādījās "uzrauga" komponente, kas seko galvenā aģenta darbībai un pamudina to pareizajā virzienā, ja tas iestrēgst vai atkārtoti izvēlas neproduktīvu ceļu.
Par šī paša testa zemajiem rezultātiem iepriekš bija sarūgtinājies arī OpenAI, kura modeļi uzrādīja mazāk par 10%. OpenAI pagājušajā mēnesī veica savu izpēti un, mainot divus iestatījumus, panāca rezultātu trīskāršošanos, tomēr nesasniedza Nvidia pētnieku demonstrēto pilnīgo rezultātu.
Nvidia savai izmantotajai sistēmai devusi nosaukumu Agentic Variation Operators, un tā nav jauns komerciāls produkts, bet gan daļa no Nvidia atvērto rīku kopas ar zīmolu Nemo. Līdzīgus secinājumus jūlijā izdarīja arī Databricks, kura vadītājs Ali Godsi norādīja, ka nepareizas sistēmas izvēle var pat divkāršot AI izmantošanas izmaksas neatkarīgi no izvēlētā modeļa.
Nvidia pārstāvis uzsvēra, ka atvērtas, pielāgojamas sistēmas dod lietotājiem lielāku kontroli pār AI aģentu precizitāti un drošību, salīdzinot ar slēgtiem risinājumiem.


