PrismML сжимает ИИ-модели для работы на телефонах и компьютерах
Стартап PrismML выпустил сжатую языковую модель Bonsai 2 27B объёмом всего 5,9 ГБ, которая сохраняет почти всю производительность оригинала. Компания надеется, что мощный ИИ сможет работать прямо на личных устройствах пользователей.

ИИ-стартап PrismML в четверг представил модель Bonsai 2 27B — новейшую в своём семействе сжатых языковых моделей. Модель сжимает Qwen3.8 27B, широко используемую модель с открытым кодом от Alibaba, до всего 5,9 гигабайт — это в девять-десять раз меньше объёма оригинала. Такой размер позволяет модели работать на обычном компьютере и, возможно, на смартфоне премиум-класса.
Компанию основала группа исследователей из Калтеха, а руководит ею генеральный директор Бабак Хасиби, профессор Калтеха и специалист по технологиям сжатия. Советником стартапа выступает Йон Стойка, сооснователь Databricks и директор лаборатории Sky Computing Lab при Беркли. PrismML поддерживают инвесторы Khosla Ventures, Cerberus Capital и Калтех; компания привлекла посевной раунд на 22,25 миллиона долларов.
По словам Хасиби, метод сжатия PrismML выделяется тем, что модели практически не теряют в производительности по сравнению с оригиналами. Bonsai 2 достигает 98% суммарных результатов тестов Qwen — это улучшение по сравнению с первой версией Bonsai, выпущенной в марте, которая показывала 95%. Первую модель уже скачали более 11 миллионов раз, а новые, ещё меньшие модели компании добавили ещё 2,6 миллиона загрузок.
Технология основана на так называемых "тернарных" весах: обычно каждый вес модели требует 16 бит для хранения, а метод PrismML сокращает это до трёх возможных значений — +1, −1 или 0, что значительно уменьшает объём, необходимый модели.
Следующая цель PrismML — применить этот метод сжатия к гораздо более крупным моделям, в диапазоне нескольких сотен миллиардов параметров; выпуск ожидается в течение ближайших пары месяцев. Хасиби считает, что более крупные модели будет проще сжимать без потери "интеллекта". Стойка отмечает, что эта технология может сделать продвинутый ИИ бесплатным и более приватным, поскольку он будет работать непосредственно на устройствах пользователей, а не отправлять данные в облако.


