🚀 Скорость работы LLM на чипах Apple Silicon: результаты тестов
Проведены замеры скорости инференса различных LLM на M4 Mac mini (16 ГБ, 120 ГБ/с) через Ollama 0.31.2. Модель Llama 3.2 3B показала 46.7 tok/s, Mistral 7B — 22.8 tok/s, а DeepSeek R1 8B — 20 tok/s.
🌍 Данные подтверждают прямую зависимость скорости генерации LLM на архитектуре Apple Silicon от пропускной способности памяти (memory bandwidth), что критично при планировании локальных AI-инфраструктур.
👤 Вы можете оценить реальную производительность конкретных моделей (Llama, Mistral, Qwen) на Mac mini с чипом M4, чтобы понять, подходят ли такие устройства для локального запуска нейросетей.
Источник 1: https://macyou.co/benchmarks