Официальный YouTube-канал PyData выложил 23 августа запись 50-минутного доклада «The d9d Project: Building an extensible and scalable distributed training framework for LLMs» с конференции PyData & PyCon Yerevan 2026. Максим Афанасьев из Tochka рассказывает в нём о d9d — открытом фреймворке распределённого обучения больших языковых моделей, нативно построенном на примитивах PyTorch 2.0.

image
image

Что произошло

Конференция PyData & PyCon Yerevan 2026 проходила 24–25 июля в Ереване, сессия о d9d состоялась 24 июля и длилась 50 минут. Выступал Максим Афанасьев (Maksim Afanasyev), Lead Research Engineer и инженерный менеджер в Tochka, ведущий 15-команду по разработке базовых моделей. Он прошёлся по фреймворку от основ до API: масштабирование от отладки на одном GPU до 6D-параллелизма на кластере, стриминг-движок распределённого чекпоинтинга с графовыми трансформациями состояния модели, переделанный pipeline parallelism на базе torch.distributed.pipelining и интеграция Triton/CUDA-расширений. Исходный код d9d опубликован на GitHub под лицензией Apache-2.0.

Контекст

Это не релиз и не новая версия: фреймворк уже был доступен на GitHub до доклада, поэтому публикация записи — не бизнес-событие, а рыночный сигнал. В инфраструктуре обучения LLM сложился разрыв между двумя полюсами: монолитными фреймворками вроде Megatron-LM, которые трудно расширять под экспериментальные workflows, и сборкой распределённой среды с нуля, требующей глубокой экспертизы в низкоуровневых примитивах. Новой архитектуры или метода обучения в d9d нет: 6D-параллелизм, pipeline parallelism и распределённый чекпоинтинг — давно известные техники, а вклад проекта — в их white-box связке прямо на примитивах PyTorch 2.0 вместо обёрток вроде DistributedDataParallel. Фреймворк вырос из боевого опыта команды Tochka в обучении крупных базовых моделей.

Почему это важно для индустрии

Для отрасли d9d — открытая «середина» в инфраструктуре обучения LLM между Megatron-LM и сборкой распределённого стека с нуля: порог входа в distributed training становится дешевле и ниже для команд, обучающихся собственные модели, а у тех, чьи экспериментальные workflows упираются в жёсткость монолитных фреймворков, появляется рабочая альтернатива, которую можно исследовать и встроить в research-пайплайн. Станет ли d9d сравнимой альтернативой в пайплайнах небольших research-команд, покажет появление воспроизводимых бенчмарков производительности и MFU на фиксированных топологиях и стабильного CI; на горизонте двух лет исход определится не архитектурой, а скоростью поддержки и ритмом релизов.

Почему это важно для пользователей

Для читателя это практичный разбор того, как сейчас распределённо обучают большие LLM, от основ параллелизма до конкретных API фреймворка. Репозиторий d9d-project/d9d можно склонировать, прочитать реализацию и прогнать тесты на своём железе, а также позаимствовать инженерные приёмы для сложных Python-систем: строгий линтинг, статическую типизацию и тестирование локальных и распределённых конфигураций. Для production-систем существенных немедленных изменений нет.

Что пока неизвестно / ограничения

В доступных источниках нет публичных бенчмарков эффективности, данных об эксплуатации вне авторов и метрик зрелости фреймворка. Фраза «tries to be efficient yet hackable» в описании репозитория — самохарактеристика, а не результат бенчмарка, а заявленные свойства подкреплены ни методологией, ни числами. Качество ключевого компонента — стриминг-движка распределённого чекпоинтинга — подтверждается пока только самим кодом, а отказоустойчивость не проверялась fault-injection тестами. Опыт команды Tochka по масштабированию MoE-моделей до 235 млрд параметров подтверждает компетенцию авторов, но прямо не указано, что в том ране использовался именно d9d, поэтому это не валидирует сам фреймворк.

Источники

Автор

Look at AI, редакция