🚀 Speculative decoding ускоряет локальные LLM в 2.5 раза
Метод позволяет увеличить скорость генерации текста без потери качества. Технология использует маленькую быструю модель (draft model) для предсказания токенов, которые затем проверяются основной моделью за один проход.
🌍 Переход к архитектурно встроенному MTP (Multi-Token Prediction) позволяет значительно повысить эффективность использования памяти GPU.
👤 Пользователям Ollama, LM Studio или llama.cpp это обеспечит кратный прирост скорости, особенно в задачах кодинга.
Источник 1: https://vettedconsumer.com/speculative-decoding-explained-the-free-speed-toggle-your-local-llm-is-probably-not-using/
