Исследовательская группа Ant International (ant-intl) выпустила Code2Skill — пайплайн, который превращает исходный код из открытых репозиториев в «скиллы», то есть процедурные знания для кодинг-агентов, и выложила датасет DeveloperSkills-Code2Skill (CodeSkillBank) на Hugging Face. В банке 1 006 822 принятых скилл-записи из 19 769 репозиториев GitHub с 500+ звёздами, и каждая прошла проверку реконструкцией кода под контролем LLM-судьи. Подключение таких скиллов даёт измеримый прирост по широкой оценочной сетке «модель×бенчмарк». Датасет весом 619 МБ уже доступен для скачивания, а вот код самого пайплайна пока закрыт — проект в статусе pre-release.



Что произошло
Code2Skill — это конвейер, который извлекает процедурные знания («скиллы») напрямую из исходного кода открытых репозиториев; параллельно ant-intl выложила на Hugging Face датасет DeveloperSkills-Code2Skill, известный как CodeSkillBank. Скиллы в банке трёх типов — атомарные операции, составные workflow и повторяющиеся паттерны; на уровне карточек для ретривала это 750 748 purpose-карточек и 3 600 подтверждённых паттернов. Каждая запись хранит условия применения, инварианты, анти-цели, кейсы отказа и провенанс, а проверяется через source-body-blind reconstruction: модель реконструирует код по скиллу, не видя тела исходника, после чего source-aware «судья» сверяет реконструкцию с оригиналом — это LLM-проверка согласованности, а не формальное доказательство эквивалентности. Эффект измерен на сетке из 9 конфигураций моделей (DeepSeek DS4-Flash, Qwen3.5/Qwen3.6 27B, Gemini 2.5 Pro, GPT 5.2) и 8 бенчмарков (SWE-bench Verified, AIME 2026, HMMT 2025, GPQA, TerminalBench и другие): макро-среднее по 72 парам «модель×бенчмарк» выросло с 42,90 до 47,90, улучшения зафиксированы в 57 из 72 пар, а на SWE-bench Verified улучшились все 9 пар. Датасет выложен на Hugging Face весом 619 МБ, с конфигурациями cards/edges/pattern_annotations и join по purpose_id.
Контекст
До сих пор скиллы для кодинг-агентов добывали в основном из траекторий: подходы вроде Trace2Skill предполагают, что целевой агент уже успешно отработал задачи, и лишь потом из его опыта можно что-то извлечь. Code2Skill берёт знания из кода — они доступны до любого взаимодействия с задачей и проверяемы после абстракции, так что это независимый и масштабируемый канал процедурной памяти, а не дубль существующего. По сути это первый крупный скилл-банк процедурных знаний, построенный из кода, а не из траекторий агента, и при этом прежде всего сильный ресурсный вклад, а не методологический прорыв: масштаб проверенного банка здесь важнее новизны самого механизма. Работа встраивается в линию исследований скилл-банков рядом с Trace2Skill и ExpeL и даёт этим методам общую воспроизводимую точку сравнения.
Почему это важно для индустрии
Для индустрии значима прежде всего измеримость: заявленный прирост охватил большинство пар «модель×бенчмарк» из оценочной сетки, а датасет даёт методам построения скилл-банков вроде Trace2Skill и ExpeL общую точку сравнения и готовый материал для retrieval, планирования и coding RL. Продуктовый рычаг лежит не в воспроизведении конвейера, а в потреблении банка: проверенные карточки можно встраивать в ретривал, планирование и пост-ревью кодинг-агента без ожидания открытия кода. Релиз меняет экономику слоя: «процедурные знания в ретривале» коммодитизируются как бесплатный входной ресурс, а защищаемыми остаются собственный пайплайн генерации — Ant International держит его закрытым — вертикальные скилл-банки под конкретные стеки и способ их использования в продукте. В ближайшие месяцы вероятны независимые проверки, открытые ре-имплементации пайплайна и первые продукты вокруг скилл-поиска и доменных банков; если код откроют, компании смогут строить собственные скилл-банки под свои кодовые базы, что изменит экономику процедурной памяти, а если нет — датасет останется замороженным срезом. В перспективе двух лет скилл-банки из кода могут стать стандартным слоем агентных стеков наряду с retrieval и RL, а «скиллы из кода против скиллов из траекторий» — осью сравнения методов.
Почему это важно для пользователей
Если вы собираете агентов или ретривал-пайплайны, эксперимент доступен без ожиданий: скачайте CodeSkillBank с Hugging Face, поднимите retrieval по purpose-карточкам и A/B-сравните агента со скиллами и без на внутренних задачах уровня SWE-bench Verified. Карточки удобно подключать как контекст планировщика и первичной генерации, а анти-цели и кейсы отказа превращать в чек-листы для пост-ревью кода — например, проверять, что агент не наступает на известные анти-паттерны. Стоимость такого эксперимента минимальна, потому что скиллы потребляются как готовые данные и не требуют доступа к генерации. Единственная рамка — воспроизвести банк на своих репозиториях пока не получится: доступно только потребление готового датасета.
Что пока неизвестно / ограничения
Верификация банка вероятностная: source-aware «судья» сверяет реконструкцию с оригиналом как LLM-проверку согласованности, а не формальное доказательство эквивалентности, поэтому качество банка ограничено качеством судьи. Прирост на математических бенчмарках AIME 2026 и HMMT 2025 от именно кодинг-скиллов — неожиданный сигнал: без абляций со случайными или пустыми скиллами и с контекстом сопоставимого объёма механизм прироста не локализован, возможен как перенос, так и контаминация — репозитории из SWE-bench Verified это популярные проекты, которые, вероятно, входят в выборку 500+ звёздных репозиториев. Код пайплайна закрыт: статус pre-release, приватный репозиторий без лицензии, поэтому независимой проверки самого конвейера нет. Корректно ограничивать уверенность уровнем «датасет как артефакт проверен», а не «заявления о приросте доказаны»: впереди абляции, тесты на контаминацию и сравнение с Trace2Skill и ExpeL на общей базе. Наконец, правовой статус скиллов, выведенных из чужого кода, пока не определён, а стоимость верификации LLM-судьёй в масштабе может стать сдерживающим фактором для всей линии скилл-банков.
Источники
- Code2Skill — Developer Skills from Real Code (DeveloperSkillHubs, проектная страница Ant International Research)
- GitHub — ant-intl/Code2Skill: Grounded synthesis of reusable procedural skills from source code
- Hugging Face — ant-intl/DeveloperSkills-Code2Skill (датасет CodeSkillBank, 619 МБ)
Автор
Look at AI, редакция
