IFM выпустила открытую MoE-модель K2-Horizon-MoVA-36B-A4B под лицензией Apache 2.0. В ней 36B общих параметров, но на каждый токен активируется только 4B, вместо стандартного внимания работает собственный приём Mixture-of-Values (MoVA), а нативный контекст составляет 512K токенов. Финальный checkpoint уже опубликован и доступен для скачивания.



Что произошло
По данным официального model card, модель набирает 58.6% на Terminal-Bench 2.1, 26.8% на tau3-Banking, 80.8% на GPQA Diamond и 38.9% на SciCode; IFM заявляет, что K2-Horizon-MoVA-36B-A4B обгоняет открытые dense-модели класса ~30B и MoE-модели до 15 раз крупнее и конкурирует с закрытыми frontier-моделями. Вместе с релизом компания обещает опубликовать промежуточные checkpoints, данные, рецепт обучения и код, а старшей моделью семейства называется K2-Horizon-375B-A23B.
Контекст
Архитектура построена на MoE: общая вместимость 36B параметров распределена между экспертами, и стоимость инференса определяется числом активных параметров, поэтому конфигурация с 4B активных параметров влезает в железо, куда dense-модель сопоставимого качества не поместится. MoVA заменяет стандартное внимание смесью значений вместо одного на каждый запрос внимания, что заявляется как более высокая выразительность при тех же затратах. Нативный контекст в 524288 токенов появился уже на этапе midtraining, задолго до финального релиза.
Почему это важно для индустрии
Открытая MoE с 4B активных параметров и заявленными frontier-class результатами сужает разрыв в стоимости инференса для агентных продуктов и кодинг-инструментов. Если self-reported бенчмарки подтвердятся, MoVA-внимание станет конкретной архитектурной альтернативой для agent-нагрузок и кодинга, а обещанный релиз данных, рецепта и кода обучения позволит независимым командам проверить рецепт и сделать K2-Horizon-MoVA-36B-A4B реперной точкой для открытых MoE класса ~30B. Ключевой тест для всей архитектуры — старшая модель семейства K2-Horizon-375B-A23B: подтвердив эффективность MoVA при росте масштаба, семейство может задать новый ориентир cost/capability для открытых агентских моделей.
Почему это важно для пользователей
Модель можно скачать и запустить уже сейчас: в карточке приведены рабочие рецепты vLLM (tensor-parallel 2, --reasoning-parser k2_horizon, --enable-expert-parallel) и SGLang, валидированные на 2x H200, а на Hugging Face доступны квантизации 4/6/8-bit и MLX-сборки. Это готовый вариант для экспериментов, внутренней автоматизации и прототипов агентных и кодинг-продуктов на собственном железе, где длинный нативный контекст покрывает протяжённые агентные цепочки и крупные документы без обрезки, а запуск не требует ждать API или согласования лицензионных условий.
Что пока неизвестно / ограничения
Все бенчмарк-цифры взяты из model card IFM и являются self-reported: независимых репродукций нет, а публичных таблиц сравнения с конкретными базовыми моделями (какие именно dense ~30B и какие MoE до 15 раз крупнее) источники не содержат, как и latency/throughput-данных. Результаты неоднородны: 80.8% на GPQA Diamond при 26.8% на tau3-Banking. Ни статьи, ни аблейшнов, показывающих вклад MoVA отдельно от MoE, опубликовано не было, обещанные данные, рецепт и код пока не вышли, а 512K контекст, кастомное MoVA-внимание и особые флаги запуска создают операционные риски для production, которые нужно закрыть собственными замерами.
Источники
- IFM/K2-Horizon-MoVA-36B-A4B · Hugging Face (official model card)
- IFM/K2-Horizon-375B-A23B · Hugging Face
- K2-Horizon-MoVA-36B-A4B quantizations · Hugging Face models index
Автор
Look at AI, редакция
