среда, 26 августа 2026 г.
Rīga TV

Мировые и латвийские новости в одном месте

ТехнологииОпубликовано: 26 августа 2026 г. в 20:38

Google представила новую модель Gemini, превращающую бессвязную речь в структурированный текст

Google представила Gemini 3.5 Transcribe — новую аудиомодель, которая преобразует неупорядоченную речь в оформленный текст и вскоре появится в любом текстовом поле браузера Chrome. Модель распознаёт более 85 языков и может различать до трёх говорящих.

Foto: Engadget

Google анонсировала новую аудиомодель искусственного интеллекта Gemini 3.5 Transcribe, которая пополнила семейство Gemini Audio наряду с Gemini 3.5 Live и Gemini 3.5 Live Experimental. Компания утверждает, что новая модель обеспечивает более точное распознавание речи по сравнению с предыдущими версиями и способна автоматически определять более 85 языков.

Одна из ключевых особенностей модели — способность превращать несвязную, естественную речь пользователя в аккуратный, оформленный текст. Система умеет обрабатывать самоисправления говорящего, убирать слова-паразиты и сохранять исходный смысл сказанного. Редактировать полученный текст можно и с помощью голосовых команд.

Дополнительные возможности

По словам Google, Gemini 3.5 Transcribe способна запоминать индивидуальный словарный запас пользователя и нестандартные варианты написания слов, а также точно распознавать буквенно-цифровые последовательности, например номера заказов или почтовые индексы. Модель также может различать до трёх разных говорящих с временными метками на уровне отдельных слов при работе с заранее записанным аудио — это может пригодиться, например, при расшифровке подкастов.

Новая модель уже используется в функции Rambler на устройствах Android, включая смартфоны линейки Pixel 11, а также в приложении Gemini для macOS, где она может работать совместно с другими моделями Gemini для выполнения более сложных агентных задач.

Google также сообщила, что в скором времени преобразование речи в текст станет доступным в любом поле на веб-странице через браузер Chrome — пользователи смогут надиктовывать ответы и посты или отдавать голосовые команды Gemini. Модель уже доступна на платформе для разработчиков Google Antigravity и в ближайшее время появится в Search Live, Gemini Live, а также в Docs, Keep и Gmail. Разработчики смогут получить доступ к модели через API.

Комментарии

0/1500

Комментарии модерируются автоматически. Запрещены ненависть, угрозы, личные данные и спам.

Загрузка комментариев…

Ещё в этой категории

Технологии

Исследование: изменение климата подвергает 560 миллионов детей дополнительному тепловому стрессу

Новое исследование в журнале Science Advances показывает, что из-за изменения климата 560 миллионов детей младше 10 лет ежегодно получают как минимум один дополнительный месяц опасной жары. Учёные предупреждают, что младенцы особенно уязвимы к перегреву.

The Verge · 1 мин назад

Технологии

Кибератака нарушила работу производителя медицинских устройств Boston Scientific по всему миру

Американский производитель медицинских устройств Boston Scientific сообщил, что кибератака вызвала сбои в его IT-системах, затронув отгрузку и обработку заказов. Компания не уточнила, коснулись ли перебои пациентов с имплантированными устройствами.

TechCrunch · 3 мин назад

Технологии

Кандидаты в США подписывают обязательство ужесточить регулирование дата-центров и ИИ

Более 15 кандидатов на выборные должности в разных штатах США подписали так называемый AI Pact — обязательство добиваться более строгого регулирования дата-центров и искусственного интеллекта. Это отражает растущую обеспокоенность избирателей их влиянием на экологию и цены на электроэнергию.

Wired · 57 мин назад