3 сентября 2026 на arXiv вышла статья «Compile by Training» исследователей из University of Waterloo, представляющая нейрокомпилятор, расширяющий подход Program-as-Weights (PAW): вместо обращения к дорогой крупной модели на каждый вход текстовое описание задачи за примерно минуту превращается в маленький локальный артефакт, который исполняется локальным интерпретатором без вызовов учителя.


Что произошло
Статья, опубликованная под номером 2609.04199, принадлежит перу Yuntian Deng, Pengyu Nie и Stuart Shieber. В способе работы учительская модель (например, gpt-5.5) генерирует обучающие примеры по текстовому описанию задачи, после чего общий локальный интерпретатор примерно 0.6B параметров дообучается на них через LoRA около минуты. Результатом становится файл .paw, содержащий лёгкий адаптер, который интерпретатор исполняет локально без обращений к учительской модели. На подмножестве FuzzyBench-Hard, где быстрый PAW-компилятор не дал ни одного точного совпадения, метод достигает 83.6% семантической точности. Код компилятора открыт на GitHub под лицензией MIT: для работы нужны Python 3.10+, uv и ключ OpenAI API, а дефолтный рецепт рассчитан на акселератор с памятью около 40 GB. Публичный демо-плейграунд доступен по адресу programasweights.com/playground?compiler=paw-ft-bs48.
Контекст
В исходном проекте Program-as-Weights, который расширяет новый метод, уже есть быстрый компилятор: он «собирает» задачу за один forward-проход, то есть за секунды и без дополнительного обучения. Compile by Training заменяет этот мгновенный механизм на обучение: учительская модель формирует набор примеров, а интерпретатор дистиллирует задачу в небольшой LoRA-адаптер, то есть в постоянный артефакт, а не в разовый расчёт. Подход применим к задачам, которые можно формализовать как функцию «вход → выход»: классификация, парсинг, маскирование PII, перевод. Среди демонстраций из статьи — переводчик на язык Claudish, 3D-аватар, строится по естественному описанию, и локальный PII-маскер.
Почему это важно для индустрии
Для отрасли это готовый рабочий паттерн замены дорогих удалённых вызовов LLM на каждый вход локальным артефактом: небольшим адаптером поверх общего интерпретатора, который можно хранить, версионировать и комбинировать как обычный файл. Это альтернатива дообучению целых моделей под узкие текстовые задачи, а сигнал рынку состоит в том, что слой узких текстовых функций дешевеет и ускоряется. Поскольку сам компилятор открыт под лицензией MIT, защитить механизм невозможно, и дифференциальная ценность сосредоточится в конкретных .paw-артефактах и пайплайнах, построенных вокруг них.
Почему это важно для пользователей
Прямо сейчас можно открыть публичный плейграунд или склонировать MIT-репозиторий github.com/programasweights/compile-by-training, собрать .paw под собственную задачу и сравнить результат с быстрым PAW-компилятором по бенчмарку из статьи. Это адресно полезно тем, кто закрывал повторяющиеся текстовые задачи — классификацию, маскирование PII, парсинг — статическими правилами или удалёнными API-вызовами. Практический барьер входа — железо под дефолтный рецепт и ключ OpenAI API для учителя; для команд без такого акселератора пока остаются плейграунд и бенчмарки из препринта.
Что пока неизвестно / ограничения
Цифра 83.6% заявлена на подмножестве FuzzyBench-Hard, где базовый быстрый PAW-компилятор не дал ни одного точного совпадения, поэтому результату нужна независимая проверка на других наборах и с другими учительскими моделями. Живые демонстрационные сервисы — примеры развёртываний, а не контролируемые бенчмарки. В доступных материалах нет данных о задержках и надёжности .paw-артефактов в продуктивном использовании, нет сведений о коммерческом продукте или модели ценообразования, а этап учителя завязан на OpenAI API.
Источники
- arXiv — Compile by Training: Turning Natural-Language Specifications into Local Neural Functions (2609.04199)
- programasweights/compile-by-training — репозиторий кода компилятора на GitHub (MIT)
- Hugging Face Papers — Compile by Training (2609.04199)
Автор
Look at AI, редакция
