Опубликованы новые эмпирические данные о производительности языковых моделей на базе чипов Apple Silicon. Тестирование M4 Mac mini с пропускной способностью памяти 120 ГБ/с показало высокую эффективность для запуска компактных моделей через Ollama.

Что произошло

Проведены замеры скорости генерации LLM на Mac mini с чипом M4 (16 ГБ ОЗУ, 120 ГБ/с bandwidth) с использованием Ollama 0.31.2. Для Llama 3.2 3B зафиксирована скорость 46.7 tok/s, для Mistral 7B — 22.8 tok/s, а для DeepSeek R1 8B — 20 tok/s. Результаты основаны на медианном значении трех запусков с фиксированным промптом и бюджетом в 512 токенов.

Контекст

Производительность нейросетей на архитектуре Apple Silicon демонстрирует прямую корреляцию с пропускной способностью объединенной памяти (memory bandwidth), а не с вычислительной мощностью ядер чипа. Использование Ollama обеспечивает стандартизированную среду для проведения подобных локальных тестов.

Почему это важно для индустрии

Данные подтверждают, что высокая пропускная способность памяти (120 ГБ/с) делает локальный инференс моделей размером до 8B параметров коммерчески жизнеспособным для создания автономных edge-агентов и приватных AI-инфраструктур. Это позволяет инженерам более точно планировать hardware-стек при развертывании локальных RAG-систем.

Почему это важно для пользователей

Пользователи могут использовать эти показатели для оценки пригодности Mac mini M4 для запуска конкретных моделей (Llama, Mistral, Qwen) в локальном режиме. Это дает возможность быстро прототипировать приватные инструменты продуктивности и персональных AI-ассистентов, не зависящих от облачных API.

Что пока неизвестно / ограничения

Результаты специфичны для конкретной конфигурации памяти (120 ГБ/с) и версии Ollama 0.31.2. Также наблюдается различие в интерпретации данных: от чисто технического подтверждения корреляции до оценки продуктовой применимости edge-решений.

Источники

Автор

Look at AI, редакция