🔬 Periodic Labs раскрыла инфраструктуру для научного RL

Компания 15 сентября опубликовала разбор стека для reinforcement learning, где один RL-rollout идёт больше часа: пиковые 1300 GPU H200, стек на Megatron, SGLang, Miles и Ray. По её данным, обучение идёт в 4.1x быстрее Megatron-бейзлайна, а декодирование 1T-модели ускорено с 10 до 25 tok/s.

🌍 Научный RL с многочасовыми rollout'ами — отдельный класс инфраструктурных задач: стандартные решения упираются в потолок. Оптимизации уже в открытых апстримах — SGLang PR #24851 и Miles PR #1371, их можно воспроизвести.

👤 Инженерам — референс: чекпоинт триллионной модели пересобирается с Megatron на Hugging Face за 1 минуту вместо 30, а sandbox pbox даёт 4.5x меньшую латентность против hosted-провайдера. Цифры — самоотчёт компании.

Источник 1: https://periodic.com/news/ai-infrastructure-at-periodic Источник 2: https://news.ycombinator.com/item?id=49717176