NVIDIA выпустила Nemotron 3.5 Lightning — открытую модель семейства MoE с 30 миллиардами параметров, из которых активно работает 3 миллиарда на каждый токен, и прокси-библиотеку NeMo Switchyard для интеллектуального маршрутизирования запросов между моделями. Модель доступна на Hugging Face под коммерческой лицензией OpenMDW-1.1 и запускается на одном GPU.

image
image
image

Что произошло

Модель Nemotron 3.5 Lightning построена на гибридной архитектуре: сочетает Mamba-2 для эффективной обработки длинных контекстов и Transformer-слои с Multi-Token Prediction для одновременного предсказания нескольких токенов. Контекстное окно достигает 1 миллиона токенов. Модель обучена на более чем 20 триллионах токенов с отсечением данных сентябрем 2025 для претренинга и маем 2026 для посттренинга. Запуск возможен на одном GPU — от DGX Spark и H100 до RTX 5090. В комплекте поставляется NeMo Switchyard — прокси-библиотека на Rust для маршрутизации запросов между моделями: сложные задачи направляются на мощные модели, рутинные остаются на лёгких. Специкулятивное декодирование через DSpark и DFlash ускоряет вывод на 60–85%. Результаты бенчмарков: 86% точности на PinchBench, 52.8% на SWE-bench Verified.

Контекст

NVIDIA продвигает стратегию открытых моделей — Генеральный директор Дженсен Хуанг публично заявил о поддержке open-weight AI для ускорения индустрии и стимула продаж GPU. Модель лицензирована под OpenMDW-1.1, коммерческое использование разрешено. Концепция «системы моделей» (systems of models) предполагает, что вместо одной monolithic модели для всех задач используется маршрутизатор, распределяющий запросы между специализированными моделями. NeMo Switchyard интегрирован с LangChain, Kong AI Gateway, LiteLLM и платформами Nous Research (Hermes). Для дообучения предоставлен датасет для RL агентов — Nemotron-RL Agentic Terminal Pivot, а также полная документация по NeMo.

Почему это важно для индустрии

Архитектура «системы моделей» меняет экономику агентных workload. Партнёры NVIDIA демонстрируют конкретные результаты: LangChain зафиксировал снижение затрат на 74% при потере точности 6%, Cognition (Devin) — снижение стоимости на 28% при сохранении frontier-уровня точности, Boomi — 59% трафика маршрутизировано на модель в 5 раз быстрее, Classmethod — экономия 27%. MoE-конфигурация 30B / 3B активных параметров радикально снижает стоимость инференса, что делает агентные workload экономически жизнеспособными для широкого круга разработчиков. Ожидается массовый переход к архитектуре систем моделей: вместо одной тяжёлой модели — маршрутизатор плюс несколько специализированных. NeMo Switchyard может стать де-факто стандартом маршрутизации, аналогично тому как LiteLLM стал стандартом прокси-слоя.

Почему это важно для пользователей

Модель доступна прямо сейчас — веса на Hugging Face, NVIDIA NIM Playground позволяет протестировать без регистрации. Поддержка в основных inference-движках: vLLM, Ollama, LM Studio, llama.cpp — запустить локально на RTX 5090 или DGX Spark. Полная документация по дообучению через NeMo. Для продуктов, использующих агентные workflow через LangChain или LiteLLM, NeMo Switchyard можно встроить немедленно. Прямой эффект: снижение стоимости inference на рутинных этапах pipeline и освобождение ресурсов для сложных задач.

Что пока неизвестно / ограничения

Формулировка «frontier-точность» является преувеличением. 52.8% на SWE-bench Verified — хороший результат для класса 3B активных параметров, но до frontier-моделей (класс Claude, GPT-4) далеко: они достигают 70–80%+ на тех же бенчмарках. Долгосрочная устойчивость архитектуры Mamba-2 + Transformer в production-нагрузках ещё требует подтверждения. Реальная экономия 74% по LangChain может варьироваться в зависимости от конкретного workload и стратегии маршрутизации.

Источники

Автор

Look at AI, редакция