Periodic Labs — компания, которая развивает AI для high-throughput экспериментов по поиску сверхпроводников и магнитов — опубликовала 15 сентября 2026 года подробный разбор своей внутренней AI-инфраструктуры для научного reinforcement learning, где один RL-rollout может длиться больше часа. Итоговый тренировочный прогон, начатый с открытых весов, занял пиковые 1300 GPU H200 на этапах midtraining и RL, а заявленная прибавка к пропускной способности обучения относительно Megatron-бейзлайна на тех же GPU достигает 4.1x. Ключевые оптимизации компания уже вернула в открытые апстримы, однако все приводимые цифры пока остаются самоотчётом.

Что произошло
Пост «AI Infrastructure at Periodic» описывает стек, собранный на Megatron, SGLang, Miles и Ray, и подтверждает его измерениями. Декодирование 1T-параметрической модели ускорено в 2.5 раза — с 10 до 25 tok/s на запрос. Пересборка чекапоинта из формата Megatron в Hugging Face сократилась с 30 минут до 1 минуты. Собственная sandbox-система pbox, построенная на gVisor поверх Slurm-on-Kubernetes, показывает 4.5x меньшую p50-латентность передачи 1 MiB.
Контекст
Periodic Labs работает на стыке AI и экспериментальной науки: с помощью high-throughput экспериментов компания ищет сверхпроводники и магниты. Научный reinforcement learning в таком окружении устроен иначе, чем обучение обычных чат-моделей: агент выполняет длинные многошаговые сессии с вызовами инструментов, и узкие места смещаются от самого обучения к инференсу, изоляции sandbox и управлению чекапоинтами моделей на триллион параметров. Именно на этом классе нагрузки стандартные решения — Megatron как база обучения и hosted sandbox-провайдеры — упираются в потолок, поэтому компоненты приходится дорабатывать под себя. В разборе фигурируют WideEP, развязка prefill и decode, delta router replay и чанкованный offload оптимизатора в Megatron-LM; смысл развязки в том, чтобы обработку контекста и генерацию токенов можно было масштабировать раздельно.
Почему это важно для индустрии
Для индустрии главный сигнал в том, что научный RL с многочасовыми rollout'ами и вызовами инструментов оформился в отдельный класс инфраструктурных задач со своим набором паттернов. Ценность для билдеров — в переносимых артефактах: delta router replay отправлен в SGLang PR #24851, а быстрый ресхардинг — в Miles PR #1371; если изменения примут и стабилизируют, выигрыш достанется всем пользователям этих фреймворков без копирования внутреннего стека Periodic Labs. Отдельный ориентир по экономике GPU — удержание 95%+ утилизации кластера за счёт совместного использования с симуляционными workload'ами: для команд с кластерами уровня H200 это прямой способ сокращать простой дорогих карт. Наконец, подход с собственной sandbox-изоляцией показывает, что агентные нагрузки с частыми вызовами инструментов можно обслуживать своими силами, а не только через hosted-провайдеров.
Почему это важно для пользователей
Читателю-инженеру пост полезен как компактный справочник современных оптимизаций RL-стека с проверяемыми артефактами: оба упомянутых PR можно открыть в апстриме и оценить код, вместо того чтобы верить цифрам на слово. В материале показано, как триллионную Kimi K2.6 обучают полными параметрами на 64 H200 при 64K контексте, снизив пиковую память с 320 до 132 GB, — конкретный ориентир для команд, у которых нет тысяч GPU. Перенимать можно и паттерны, а не только код: развязку prefill и decode, чанкованный offload оптимизатора и gVisor-изоляцию sandbox. Развёртывать сам стек Periodic Labs напрямую нельзя: он внутренний, без API, цен и документации для третьих сторон, так что ценность материала пока референсная, а не продуктовая.
Что пока неизвестно / ограничения
Все ключевые метрики — самоотчёт Periodic Labs на её собственных измерениях: условия сравнения с Megatron-бейзлайном (конфигурация, параллелизм, контекст, batch) в доступных материалах не раскрыты, поэтому заявленные множители следует считать гипотезой до независимого воспроизведения. Второй показатель pbox — выигрыш в 3.3x — приведён без уточнения, к какой именно метрике он относится. Заявление о том, что специализированные модели Парето-доминируют GPT-6 Astra и Claude Fable 5.1, опирается на собственные X-ray diffraction оценки компании без опубликованного протокола и независимого оценивания. Апстрим-PR пока не смержены и не стабилизированы, а реакция сообщества минимальна: у обсуждения на Hacker News 2 points и 0 комментариев.
Источники
Автор
Look at AI, редакция
