Google prezentē jaunu Gemini modeli runas pārvēršanai sakārtotā tekstā
Google iepazīstinājis ar Gemini 3.5 Transcribe — jaunu audio modeli, kas nesakārtotu runu pārvērš strukturētā tekstā un drīz būs pieejams jebkurā tīmekļa laukā pārlūkā Chrome. Modelis atpazīst vairāk nekā 85 valodas un spēj nošķirt līdz trīs runātājiem.

Google ir paziņojis par jaunu mākslīgā intelekta audio modeli Gemini 3.5 Transcribe, kas pievienojas Gemini Audio saimei līdzās Gemini 3.5 Live un Gemini 3.5 Live Experimental. Uzņēmums apgalvo, ka jaunais modelis nodrošina precīzāku runas atpazīšanu nekā iepriekšējās versijas un spēj automātiski noteikt vairāk nekā 85 valodas.
Viens no modeļa galvenajiem ieguvumiem ir spēja pārvērst lietotāja nesakārtotu, brīvu runu formatētā, saprotamā tekstā. Sistēma prot atpazīt un apstrādāt runātāja pašlabojumus, izdzēst nevajadzīgus aizpildījuma vārdus un saglabāt runātāja dabisko nolūku. Tekstu var rediģēt arī ar balss komandām.
Papildu iespējas
Google norāda, ka Gemini 3.5 Transcribe spēj apgūt lietotāja individuālo vārdu krājumu un neierastus pareizrakstības variantus, kā arī precīzi atpazīt burtciparu virknes, piemēram, pasūtījumu numurus vai pasta indeksus. Modelis var arī nošķirt līdz trim runātājiem, katram vārdam piešķirot laika zīmogu, ja transkripcija tiek veidota no jau ierakstīta audio — tas noderētu, piemēram, podkāstu pārrakstīšanai.
Jaunais modelis jau tagad darbina Rambler funkciju Android ierīcēs, tostarp Pixel 11 sērijas viedtālruņos, kā arī Gemini lietotni macOS vidē, kur tā var sadarboties ar citiem Gemini modeļiem sarežģītāku uzdevumu veikšanai.
Google arī paziņoja, ka drīzumā runas pārvēršana tekstā būs pieejama jebkurā teksta laukā tīmekļa lapā, izmantojot pārlūku Chrome — tostarp atbilžu un ierakstu diktēšanai vai balss komandu došanai Gemini. Modelis jau ir pieejams arī izstrādātāju platformā Google Antigravity, un tas drīz nonāks Search Live, Gemini Live, kā arī lietotnēs Docs, Keep un Gmail. Izstrādātāji modelim varēs piekļūt, izmantojot API.


