Команда VIDRAFT представила POCKET-35B — высокоэффективную Mixture-of-Experts (MoE) модель на 35 миллиардов параметров, оптимизированную для работы на обычных процессорах без использования видеокарт.

image

Что произошло

Разработанная на базе Darwin-36B-Opus, модель POCKET-35B поддерживает формат GGUF и предназначена для использования в таких инструментах, как llama.cpp, Ollama или LM Studio. Благодаря архитектуре MoE, на процессорах Xeon она достигает скорости генерации 27.0 tok/s, что почти в 2.7 раза быстрее существующих аналогов. Размер модели варьируется от 8.2 до 21 ГБ, что позволяет запускать ее на большинстве современных ПК и смартфонах с достаточным объемом оперативной памяти.

Контекст

Развитие On-Device AI требует архитектур, которые могут эффективно распределять вычислительные ресурсы. Использование квантования GGUF и архитектуры MoE позволяет перенести выполнение сложных языковых задач с облачных серверов на локальное потребительское оборудование (Edge Computing).

Почему это важно для индустрии

Появление эффективных MoE-моделей такого масштаба, способных работать на потребительском железе без GPU, снижает порог входа для локального развертывания мощного ИИ. Это стимулирует развитие индустрии On-Device AI и позволяет разработчикам прототипировать локальных агентов и новые UX-паттерны, не зависящие от облачных API.

Почему это важно для пользователей

Обычные пользователи теперь могут запускать продвинутые языковые модели уровня 35B параметров прямо на своих смартфонах или домашних компьютерах без необходимости покупки дорогостоящих видеокарт. Это обеспечивает высокую приватность и снижает зависимость от платных подписок на облачные сервисы.

Что пока неизвестно / ограничения

Для полноценного корпоративного внедрения (enterprise-уровня) все еще требуется решение вопросов безопасности и управления данными.

Источники

Автор

Look at AI, редакция