VMTech
Обсудить проект

PrismML уменьшила Qwen3.8 27B до 5,9 ГБ без заметной потери качества

PrismML уменьшила Qwen3.8 27B до 5,9 ГБ без заметной потери качества

Стартап PrismML представил Bonsai 2 27B — сжатую версию открытой модели Alibaba Qwen3.8 27B. По заявлению компании, модель занимает 5,9 ГБ, что в 9–10 раз меньше исходного варианта по потреблению памяти, и сохраняет 98% совокупных результатов бенчмарков Qwen.

Разработчики рассчитывают, что такой размер позволит запускать рассуждающие языковые модели на персональных компьютерах и, возможно, на производительных смартфонах. PrismML не раскрывает деталей возможных переговоров с Apple: гендиректор Бабак Хассиби отказался их комментировать.

Сжатие через тернарные веса

PrismML основана исследователями Caltech, а Хассиби, профессор этого университета и специалист по технологиям сжатия, возглавляет компанию. Стартап привлёк $22,25 млн в посевном раунде; среди его инвесторов названы Khosla Ventures, Cerberus Capital и Caltech. Советником PrismML выступает сооснователь Databricks Ион Стойка.

В основе Bonsai лежит изменение представления весов — параметров, в которых модель хранит усвоенную при обучении информацию. Обычно на один вес требуется 16 бит. Подход PrismML заменяет такие значения на один из трёх вариантов: +1, −1 или 0. Компания называет эту схему тернарными весами. Меньший объём данных для параметров заметно сокращает требуемую память.

Что известно о качестве и развитии линейки

Первая модель Bonsai, выпущенная в марте, достигала 95% совокупного результата бенчмарков Qwen. В PrismML говорят, что её скачали более 11 млн раз, а ещё более компактные модели семейства набрали 2,6 млн скачиваний. У Bonsai 2 заявленный показатель вырос до 98%.

Хассиби отмечает, что полное совпадение с исходной моделью по бенчмаркам может быть недостижимо: сжатие, вероятно, всё равно влияет на результат. При этом он подчёркивает, что двухпроцентное расхождение в тестах не обязательно будет существенно для практических задач, а на точность также влияет программная среда, в которой запускается модель.

Следующая цель — более крупные модели

PrismML планирует в ближайшие месяцы применить метод к моделям с несколькими сотнями миллиардов параметров. По оценке Хассиби, у более крупных моделей больше возможностей для сжатия без утраты интеллектуальных способностей.

Для компаний ценность такого подхода связана с возможностью локального запуска продвинутых моделей на уже имеющихся устройствах. Это стоит учитывать при выборе сценариев, где данные нежелательно отправлять в облако, а доступность ИИ-функций зависит от инфраструктуры на стороне пользователя.

#aihardware#llmcompression#ondeviceai#machinelearning
Открытая аналитика
На сайте 1 просмотров
мин чтения 3 17.09.2026
Instagram

PrismML уменьшила Qwen3.8 27B до 5,9 ГБ без заметной потери качества

Открыть публикацию в Instagram ↗