PrismML уменьшила Qwen3.8 27B до 5,9 ГБ без заметной потери качества

Стартап PrismML представил Bonsai 2 27B — сжатую версию открытой модели Alibaba Qwen3.8 27B. По заявлению компании, модель занимает 5,9 ГБ, что в 9–10 раз меньше исходного варианта по потреблению памяти, и сохраняет 98% совокупных результатов бенчмарков Qwen.
Разработчики рассчитывают, что такой размер позволит запускать рассуждающие языковые модели на персональных компьютерах и, возможно, на производительных смартфонах. PrismML не раскрывает деталей возможных переговоров с Apple: гендиректор Бабак Хассиби отказался их комментировать.
Сжатие через тернарные веса
PrismML основана исследователями Caltech, а Хассиби, профессор этого университета и специалист по технологиям сжатия, возглавляет компанию. Стартап привлёк $22,25 млн в посевном раунде; среди его инвесторов названы Khosla Ventures, Cerberus Capital и Caltech. Советником PrismML выступает сооснователь Databricks Ион Стойка.
В основе Bonsai лежит изменение представления весов — параметров, в которых модель хранит усвоенную при обучении информацию. Обычно на один вес требуется 16 бит. Подход PrismML заменяет такие значения на один из трёх вариантов: +1, −1 или 0. Компания называет эту схему тернарными весами. Меньший объём данных для параметров заметно сокращает требуемую память.
Что известно о качестве и развитии линейки
Первая модель Bonsai, выпущенная в марте, достигала 95% совокупного результата бенчмарков Qwen. В PrismML говорят, что её скачали более 11 млн раз, а ещё более компактные модели семейства набрали 2,6 млн скачиваний. У Bonsai 2 заявленный показатель вырос до 98%.
Хассиби отмечает, что полное совпадение с исходной моделью по бенчмаркам может быть недостижимо: сжатие, вероятно, всё равно влияет на результат. При этом он подчёркивает, что двухпроцентное расхождение в тестах не обязательно будет существенно для практических задач, а на точность также влияет программная среда, в которой запускается модель.
Следующая цель — более крупные модели
PrismML планирует в ближайшие месяцы применить метод к моделям с несколькими сотнями миллиардов параметров. По оценке Хассиби, у более крупных моделей больше возможностей для сжатия без утраты интеллектуальных способностей.
Для компаний ценность такого подхода связана с возможностью локального запуска продвинутых моделей на уже имеющихся устройствах. Это стоит учитывать при выборе сценариев, где данные нежелательно отправлять в облако, а доступность ИИ-функций зависит от инфраструктуры на стороне пользователя.

