IBM выпустила Granite 4.2 — новое поколение открытых ИИ-моделей для локального использования
IBM представила Granite 4.2 — новое семейство языковых моделей с открытыми весами, которые можно скачать и запускать на собственной инфраструктуре. Новый релиз делает акцент на улучшенных способностях к рассуждению и работе с инструментами.

Компания IBM выпустила Granite 4.2 — новейшее поколение своего семейства языковых моделей с открытыми весами, предназначенных для пользователей, которые хотят скачивать и запускать их самостоятельно, а не полагаться на облачные сервисы. Новый релиз доступен в трёх размерах: с 3, 8 и 30 миллиардами параметров.
Как и в предыдущих версиях, IBM использует архитектуру типа "decoder-only". Все три модели изначально поддерживают контекстное окно длиной до 128 000 токенов, что позволяет обрабатывать значительно более длинные тексты за один раз.
Расширенная работа с инструментами
Варианты с 8 и 30 миллиардами параметров прошли дополнительное обучение с использованием агентного обучения с подкреплением, направленного на расширение возможностей — таких как работа с терминалом, поиск в интернете или использование внешних инструментов. Меньшая модель с 3 миллиардами параметров также поддерживает работу с инструментами, но без столь же специализированного обучения, как у более крупных версий.
Акцент на рассуждении
По словам самой IBM, Granite 4.2 — это релиз в семействе Granite, сфокусированный именно на способности к рассуждению. Когда исследователи говорят о способности модели "рассуждать", они не имеют в виду осознанное понимание задачи в том смысле, в каком это свойственно человеку. Речь идёт о функциональном рассуждении, реализуемом прежде всего через механизм "цепочки размышлений" (chain-of-thought), при котором модель переносит промежуточные результаты через несколько последовательных шагов к итоговому выводу.
Релиз выходит на фоне растущего интереса к локально запускаемым языковым моделям, которые дают организациям и разработчикам больший контроль над данными и инфраструктурой по сравнению с использованием облачных ИИ-сервисов.


