Американский стартап Prism ML выпустил Ternary Bonsai 2 27B — тернарную переработку Qwen3.8-27B, которая занимает 5,9 ГБ против примерно 54 ГБ у исходника в FP16 и сохраняет 98,2% его среднего качества на 14 бенчмарках. Полноценная модель класса 27B с рассуждениями и зрением при такой плотности помещается примерно в 6 ГБ и работает локально — от игровых видеокарт до iPhone, без отправки данных в облако.
!image.png)

Что произошло
Релиз состоялся 17 сентября 2026 года. На 14 бенчмарках Ternary Bonsai 2 27B набирает в среднем 84,78 балла против 86,32 у исходной Qwen3.8-27B в FP16 и 72,59 у стандартного 2-битного кванта IQ2_XXS; эффективная плотность составляет 1,72 бита на вес. В комплект вошли две GGUF-упаковки — PTQ1_0 (1,75 бита, 5,95 ГБ, быстрее на Ada/L4) и PQ2_0 (2,13 бита, 7,21 ГБ, быстрее на H100/Blackwell) — под специальный форк llama.cpp от Prism ML, сборка MLX на 8,60 ГБ для Apple Silicon со зрением и WebGPU-демо, работающее прямо в браузере.
Контекст
Prism ML вышел из стелс-режима в 2026 году: компанию основал профессор Калтеха Бабак Хассиби, среди инвесторов — Khosla Ventures, Cerberus, Google и Samsung. Тернарное квантование означает, что каждый вес округляется до одного из трёх значений: −1, 0 или +1. Bonsai 2 отличается от обычного пост-тренинг-кванта тем, что схема заложена на уровне формата модели: веса разбиты на группы по 128 с одним общим FP16-множителем, а фиксированное преобразование Адамара вшито в сами веса. При инференсе это преобразование нужно повторить на активациях, иначе модель выдаёт бессмыслицу, поэтому штатными инструментами релиз не воспроизвести. На этом фоне показателен контраст со стандартными 2-битными квантами: при сопоставимом размере файла они теряют заметно больше качества, и если замеры Prism ML подтвердятся независимыми прогонами, это будет самый сильный технический аргумент релиза.
Почему это важно для индустрии
Тернарная плотность переводит модель класса 27B в память 8-миллиардной модели: при том же железе это больше пользователей на один GPU и ниже энергопотребление — по замерам Prism ML, 0,714 мВт·ч на токен на RTX 4090, что на 40% экономичнее полной 8B-модели. Ставка на локальных агентов — код-агенты вроде Cline, сценарии computer-use, разбор корпоративных документов без внешних серверов — превращает приватный on-device инференс из демонстрации в рабочий сценарий и открывает класс продуктов без дорогого GPU-хостинга. Весь низкоразрядный ландшафт при этом конкурирует уже не только точностью, но и «плотностью интеллекта на гигабайт» — метрика, которая при инвесторах уровня Google и Samsung выглядит устойчивой ставкой.
Почему это важно для пользователей
Веса опубликованы на Hugging Face под Apache 2.0, а попробовать модель без установки можно через готовое WebGPU-демо в браузере. По замерам Prism ML, она выдаёт около 143 токенов в секунду на RTX 5090 и около 46,8 токенов в секунду на ноутбуке с M5 Max, а через MLX запускается даже на iPhone и iPad. Зрительный модуль вынесен в отдельный файл на 0,63 ГБ и подгружается только при подаче изображений, поэтому базовая сборка остаётся компактной. Контекст в 262 тыс. токенов и вызов инструментов позволяют разбирать большие документы и собирать агентов на своём устройстве: переписка и файлы не покидают его, а стоимость эксперимента почти нулевая — облачный бюджет не нужен.
Что пока неизвестно / ограничения
Все ключевые цифры — качество, скорость и энергопотребление — пока вендорские: независимых прогонов сообщества не публиковалось, поэтому надёжность развёртывания в продакшене придётся доказывать своими evals. Заявленное преимущество над полноценной Qwen3.6 27B (83,9 против 83,6) стоит воспринимать осторожно: разница в 0,3 балла лежит в пределах шума типичных бенчмарк-ригов, а сравниваются разные модели — тернарная переработка Qwen3.8-27B и Qwen3.6 27B, что требует одинакового набора задач и методики. Скорость зависит от оптимизации повторения преобразования Адамара на активациях в форке Prism ML, поэтому замеры нельзя напрямую переносить на другие бэкенды. Наконец, неизвестно, попадут ли тернарные ядра и поддержка Адамара в апстрим llama.cpp и MLX — без этого формат останется вендорским.
Источники
- Introducing Bonsai 2 27B: Near-Lossless Compression in a 9x Smaller Footprint — блог Prism ML
- prism-ml/Ternary-Bonsai-2-27B-gguf — карточка модели на Hugging Face
- Bonsai 2 27B whitepaper — технический документ Prism ML в репозитории PrismML-Eng/Bonsai-demo на GitHub
Автор
Look at AI, редакция
