На Hugging Face вышла подборка из пяти свежих GGUF/MLX-сборок, главная среди которых — bsaleh03/Qwen3.8-27B-ASCII-Condensed. У этого кванта Qwen3.8-27B словарь урезан с 248 320 до 129 006 строк: все не-ASCII токены удалены, освободившаяся видеопамять отдана под KV-кэш, и на 16-гигабайтной RTX 5070 Ti контекст вырос со 114 688 до 135 168 токенов без какого-либо дообучения. Цена приёма ощутимая: кириллица и CJK теперь кодируются несколькими токенами на символ, а vision-модуль выброшен. Рядом в подборке — обесцензуренный через Heretic кодинг-агент LFM2.5-2.6B и 4-битная MLX-версия той же Qwen3.8-27B для Apple Silicon.

image
image
image

Что произошло

Автор телеграм-канала GreenNeuralRobots собрал подборку из пяти свежих GGUF/MLX-сборок, опубликованных на Hugging Face. Главный артефакт — bsaleh03/Qwen3.8-27B-ASCII-Condensed: GGUF-квант Qwen3.8-27B в формате UD-IQ4_XS объёмом 13,6 ГБ под лицензией Apache 2.0, из таблицы эмбеддингов и выходной головы которого удалены все не-ASCII токены. Словарь сократился с 248 320 до 129 006 строк, а освободившаяся VRAM отдана под KV-кэш: максимум контекста вырос со 114 688 до 135 168 токенов, то есть на 20 480 токенов, в 1,18 раза, на 16-гигабайтной RTX 5070 Ti. Структурная проверка показала, что 864 из 866 тензоров бит-в-бит идентичны базовому кванту. Обратная сторона измерима: кириллица теперь стоит около трёх токенов на символ, CJK и акцентированная латиница — около двух, а vision-модуль из сборки удалён, модель работает только с текстом. Помимо неё в подборку вошли saidutta69/lfm2.5-2.6b-fable5-coding-agent-heretic — кодинг-агент на 2,6B LiquidAI LFM2.5, обесцензуренный через Heretic v1.4.0 со снижением доли отказов с 96 до 7 из 100 при KL-расходимости 0,014 и выложенный в 14 GGUF-квантах, и mlx-community/Qwen3.8-27B-4bit — 4-битная MLX-версия той же Qwen3.8-27B объёмом 16,1 ГБ.

Контекст

Механика приёма выводится из устройства трансформерного инференса. Эмбеддинг — это операция gather по словарю, выходная голова — GEMV по словарю, поэтому удаление не-ASCII строк из обеих таблиц уменьшает потребление VRAM предсказуемо и точно, а освободившуюся память можно целиком отдать под KV-кэш, расширяя контекст. Дообучение при этом не требуется: веса остаются прежними, меняется лишь размер таблиц словаря. Автор выложил воспроизводимые инструменты прайнинга на GitHub, так что приём повторяем на других моделях и других доменах словаря. Параллельно в экосистеме abliteration закрепился конвейер Heretic: обесцензуренные варианты свежих моделей появляются в первые дни после их выхода, как произошло с LFM2.5-2.6B. Подборка в целом показывает зрелость локальной сцены: доменные GGUF-сборки, MLX-квантование для Apple Silicon и abliteration существуют как отлаженные, готовые к использованию маршруты.

Почему это важно для индустрии

Для отрасли приём демонстрирует, что контекст локальных LLM можно расширять без дообучения, перераспределяя VRAM между словарём и KV-кэшем: длинный контекст на 16-гигабайтных картах превращается из фичи в коммодити, а юнит-экономика локальных AI-продуктов улучшается почти бесплатно. Защитной позиции у техники нет: инструменты прайнинга публичны, веса Qwen3.8-27B распространяются под Apache 2.0, поэтому конкурентное преимущество смещается из метода в продукт вокруг него. Если независимые проверки подтвердят сохранение качества, прайнинг словаря может стать штатным шагом при сборке доменных GGUF под конкретный язык или задачу, а дальше — опцией инференс-стеков и квантизаторов, где «редакция модели под словарь» задаётся конфигурацией, а не отдельным дообучением. Отдельный сигнал для разработчиков и дистрибьюторов: конвейер Heretic выпускает обесцензуренные варианты свежих моделей в первые дни после релиза, и это уже устойчивая, а не разовая практика экосистемы.

Почему это важно для пользователей

Если у вас карта на 16 ГБ и вы работаете с кодом или английским текстом, ASCII-Condensed даёт 135 168 токенов контекста в llama.cpp одной командой: вложения уходят в системную RAM через -ot "token_embd.weight=CPU", потеря скорости около 1%. Для русского языка сборка не подходит — примерно три токена на символ съедят весь выигрыш, для кириллицы лучше взять исходную сборку. Обесцензуренный lfm2.5-2.6b-fable5-coding-agent-heretic в кванте Q4_K_M весит 1,56 ГБ и запускается даже на 6-гигабайтной карте через Ollama или LM Studio — вариант для экспериментов с локальным кодинг-агентом на слабом железе. Замыкает набор parakeet-tdt-0.6b-v3 в Q8_0: компактный офлайн-распознаватель речи весом 740 МБ с поддержкой русского и WER 6,54% на FLEURS.

Что пока неизвестно / ограничения

Структурная идентичность 864 из 866 тензоров — это проверка целостности, а не оценка качества: перплексий и long-context бенчмарков после прайнинга в источниках нет, измерений латентности тоже. Даже для чисто ASCII-промптов выходное распределение не бит-в-бит идентично базовому кванту, поскольку softmax-нормализация теперь идёт по урезанному словарю из 129 006 строк. Заявленные метрики Heretic (доля отказов и KL-расходимость) измеряют вмешательство и близость к базе, но не сохранение кодинг-способностей агента. Прогнозы о превращении прайнинга словаря в штатную опцию инференс-стеков — интерпретация, а не установленный факт. Наконец, vision-модуль в сборке отсутствует, так что мультимодальные сценарии недоступны.

Источники

Автор

Look at AI, редакция