🛠 Qwen3.8-27B с ASCII-словарём: 135К контекста на 16 ГБ VRAM
В подборке пяти свежих GGUF/MLX-сборок на Hugging Face главная — bsaleh03/Qwen3.8-27B-ASCII-Condensed: у кванта UD-IQ4_XS (13,6 ГБ) словарь урезан с 248 320 до 129 006 строк — убраны все не-ASCII токены, освободившаяся VRAM отдана под KV-кэш, и контекст вырос до 135 168 токенов на RTX 5070 Ti.
🌍 Приём расширяет контекст локальных LLM без дообучения: эмбеддинг — gather, выходная голова — GEMV по словарю, урезание обеих таблиц освобождает VRAM ровно под KV-кэш. Инструменты прайнинга — на GitHub.
👤 На 16 ГБ — 135К контекста в llama.cpp одной командой (потеря скорости ~1%), но для русского сборка не годится: ~3 токена на символ. Обесцензуренный через Heretic v1.4.0 LFM2.5-2.6B в Q4_K_M весит 1,56 ГБ и идёт на 6 ГБ VRAM.
Источник 1: https://huggingface.co/bsaleh03/Qwen3.8-27B-ASCII-Condensed Источник 2: https://huggingface.co/saidutta69/lfm2.5-2.6b-fable5-coding-agent-heretic
