Корейская компания Upstage представила Solar Open 2 — суверенную open-weight модель на базе архитектуры Mixture-of-Experts (MoE). Модель обладает общим числом параметров 250B, при этом всего 15B параметров активны на один токен, что обеспечивает высокую эффективность при сохранении интеллектуальных возможностей.



Что произошло
Разработчики из Upstage выпустили Solar Open 2, которая поддерживает контекстное окно объемом до 1 млн токенов. Это стало возможным благодаря гибридной архитектуре внимания, состоящей на 75% из Linear Attention и на 25% из Grouped-Query Attention (GQA). Модель специально оптимизирована для агентских сценариев, таких как написание кода, работа с инструментами и многошаговое рассуждение, демонстрируя высокие результаты в бенчмарках LiveCodeBench (92.4) и APEX-Agents.
Контекст
Современные задачи AI-агентов часто требуют обработки огромных объемов данных и выполнения последовательных логических операций. Использование архитектуры MoE в сочетании с гибридным механизмом внимания позволяет сбалансировать вычислительную сложность и способность удерживать длинные зависимости в тексте, что является критическим фактором для создания автономных систем.
Почему это важно для индустрии
Появление сильной open-weight альтернативы снижает глобальную зависимость индустрии от проприетарных API, таких как GPT-4. Эффективная архитектура MoE и возможность работы с гигантским контекстом позволяют компаниям создавать специализированные, суверенные решения для автоматизации процессов, значительно сокращая расходы на инфраструктуру и API-вызовы.
Почему это важно для пользователей
Пользователи получают возможность развертывать высокоэффективных AI-агентов на относительно доступном оборудовании. Благодаря квантизации, модель может работать, например, на двух GPU H200, что открывает путь к локальному анализу сверхдлинных документов, автоматизации сложного программирования и созданию персональных помощников с сохранением приватности данных.
Источники
Автор
Look at AI, редакция
