🤖 🌟 Prism ML собрала тернарную версию Qwen3.8-27B

Prism ML 17 сентября 2026 года выпустила Ternary Bonsai 2 27B — тернарную (веса −1/0/+1) переработку Qwen3.8-27B: 5,9 ГБ вместо ~54 ГБ в FP16 и 98,2% среднего балла на 14 бенчмарках. Плотность — 1,72 бита/вес, контекст — 262 тыс. токенов, лицензия Apache 2.0.

🌍 27B-модель сжалась до объёма 8-миллиардной: на том же железе это больше пользователей на GPU и ниже энергопотребление — 0,714 мВт·ч/токен на RTX 4090, на 40% экономичнее 8B. Ставка Prism ML — приватный инференс: код-агенты и документы без облака.

👤 Модель с рассуждениями и зрением занимает 5,95 ГБ: RTX 5090 даёт ~143 токенов/с, M5 Max — ~46,8, работает и на iPhone/iPad через MLX. Нюанс: нужен форк llama.cpp от Prism ML — без вшитого преобразования Адамара модель выдаёт бессмыслицу. Есть WebGPU-демо.

Источник 1: https://prismml.com/news/bonsai-2-27b Источник 2: https://huggingface.co/prism-ml/Ternary-Bonsai-2-27B-gguf