Amazon iznīcina retas grāmatas, lai iegūtu datus AI apmācībai
Izmeklēšana atklājusi, ka Amazon iepērk retas, senas grāmatas, izgriež to iesējumus un skenē tekstu, lai izmantotu mākslīgā intelekta valodas modeļu apmācībā. Šādas grāmatas ir vērtīgas, jo to teksts nav pieejams internetā un nevar būt AI ģenerēts.

Izdevums 404 Media veicis izmeklēšanu, kurā ievietojis izsekošanas ierīci retā grāmatā, lai noskaidrotu, kur nonāk Amazon iepirktās senās izdevumu kopijas. Ierīce galu galā novedusi pie Amazon noliktavas Lasvegasā ar nosaukumu VGT3, kuras simbols ir dinozaurs, kas ķepās tur grāmatu. Izmeklēšana liecina, ka uzņēmums iepērk retas grāmatas, nogriež to iesējumus un skenē lapas, lai iegūtu tekstu mākslīgā intelekta valodas modeļu apmācībai.
Amazon paziņojumā 404 Media apstiprinājis, ka iegādājas grāmatas caur komerciāliem kanāliem, lai uzlabotu produktus un pakalpojumus, ko izmanto klienti, taču neprecizēja, vai tās tiek izmantotas tieši AI modeļu apmācībai.
Kāpēc tieši retas grāmatas
Lieli tehnoloģiju uzņēmumi, tostarp Amazon, savu valodas modeļu apmācībai patērē milzīgus teksta apjomus, un internetā pieejamie avoti jau lielā mērā izsmelti. Daži uzņēmumi, piemēram, Anthropic, iepriekš saskārušies ar apsūdzībām par nelegāli iegūtu, pirātiskiem grāmatu tekstiem. Retas un no apgrozības izņemtas grāmatas, kuru saturs nav atrodams internetā, kļuvušas par jaunu, vērtīgu datu avotu.
Īpaša šo grāmatu vērtība slēpjas apstāklī, ka jebkurš teksts, kas publicēts pirms 2022. gada, droši nav radīts ar mākslīgo intelektu. Tas ir svarīgi, jo modeļu apmācība ar pārāk lielu daudzumu AI ģenerēta teksta var izraisīt tā saukto "modeļa sabrukumu" — parādību, kad valodas modeļa izvades kvalitāte pasliktinās, ja tas apmācīts uz paša vai citu modeļu radīta satura pamata.


