Опубликованы новые эмпирические данные о производительности языковых моделей на базе чипов Apple Silicon. Тестирование M4 Mac mini с пропускной способностью памяти 120 ГБ/с показало высокую эффективность для запуска компактных моделей через Ollama.
Что произошло
Проведены замеры скорости генерации LLM на Mac mini с чипом M4 (16 ГБ ОЗУ, 120 ГБ/с bandwidth) с использованием Ollama 0.31.2. Для Llama 3.2 3B зафиксирована скорость 46.7 tok/s, для Mistral 7B — 22.8 tok/s, а для DeepSeek R1 8B — 20 tok/s. Результаты основаны на медианном значении трех запусков с фиксированным промптом и бюджетом в 512 токенов.
Контекст
Производительность нейросетей на архитектуре Apple Silicon демонстрирует прямую корреляцию с пропускной способностью объединенной памяти (memory bandwidth), а не с вычислительной мощностью ядер чипа. Использование Ollama обеспечивает стандартизированную среду для проведения подобных локальных тестов.
Почему это важно для индустрии
Данные подтверждают, что высокая пропускная способность памяти (120 ГБ/с) делает локальный инференс моделей размером до 8B параметров коммерчески жизнеспособным для создания автономных edge-агентов и приватных AI-инфраструктур. Это позволяет инженерам более точно планировать hardware-стек при развертывании локальных RAG-систем.
Почему это важно для пользователей
Пользователи могут использовать эти показатели для оценки пригодности Mac mini M4 для запуска конкретных моделей (Llama, Mistral, Qwen) в локальном режиме. Это дает возможность быстро прототипировать приватные инструменты продуктивности и персональных AI-ассистентов, не зависящих от облачных API.
Что пока неизвестно / ограничения
Результаты специфичны для конкретной конфигурации памяти (120 ГБ/с) и версии Ollama 0.31.2. Также наблюдается различие в интерпретации данных: от чисто технического подтверждения корреляции до оценки продуктовой применимости edge-решений.
Источники
Автор
Look at AI, редакция