Компания Moonshot AI опубликовала подробности архитектуры своей новой модели Kimi K3, которая предлагает радикально новый подход к работе с сверхдлинным контекстом через гибридную схему механизмов внимания.
Что произошло
В новом техническом отчёте Moonshot AI описана архитектура Kimi K3, состоящая из 93 слоев. Модель использует уникальную комбинацию блоков, включающих 3 слоя KDA и один глобальный слой MLA. Кроме того, в архитектуре реализован механизм Attention Residuals для эффективного извлечения информации из ранних блоков и обновленная структура Mixture-of-Experts (MoE), где количество экспертов увеличено до 896 (в K2 было 384). Для оптимизации обучения и балансировки нагрузки внедрены функции активации SiTU-GLU и Quantile Balancing.
Контекст
Традиционные модели сталкиваются с проблемой линейного раздувания KV-кэша при обработке длинных последовательностей, что делает работу с огромными контекстами чрезвычайно ресурсозатратной. Предыдущая итерация, K2, использовала иную структуру, в то время как K3 фокусируется на гибридном подходе (KDA + MLA) и масштабируемости MoE для решения проблем эффективности памяти и инференса.
Почему это важно для индустрии
Переход от монолитных механизмов внимания к гибридным схемам KDA и MLA задаёт новый вектор в индустрии, предлагая альтернативу стандартным методам масштабирования RoPE. Использование Attention Residuals и оптимизация MoE с большим числом экспертов позволяют создавать более масштабируемые модели, способные эффективно управлять ресурсами памяти при работе с экстремально длинным контекстом.
Почему это важно для пользователей
Для конечных пользователей и разработчиков приложений это означает возможность работы с колоссальными объемами данных — до одного миллиона токенов — без критического замедления работы или резкого роста потребления памяти. Это открывает путь к созданию продвинутых ИИ-агентов, способных анализировать целые библиотеки книг, огромные кодовые базы или сложные юридические архивы в рамках одного сеанса.
Источники
Автор
Look at AI, редакция
