NVIDIA Labs представила SoL-Pi (arXiv:2609.20519, 17 сентября 2026) — открытую систему, в которой кодинг-агенты сами искали улучшения собственной обвязки: из 152 выдвинутых гипотез честный отбор выдержали только четыре механизма, которые на изолированном бенчмарке EdgeBench сокращают трафик токенов на 44.7–49.0% и API-расходы примерно на треть без потери качества. Код распространяется под лицензией MIT как опциональное расширение харнесса Pi 0.85.1.


Что произошло
Команда NVIDIA Labs опубликовала проект SoL-Pi, автоматизирующий разработку обвязки (harness) для кодинг-агентов: агенты сами проводили авто-ресерч циклы по 152 выдвинутым гипотезам, из которых выжили только четыре механизма — примерно одна идея из сорока. Поиск шёл на 535 средах, собранных из 495 задач на парах GitHub issue-PR и 40 синтетических, а финальная проверка прошла на изолированном 51-задачном бенчмарке EdgeBench, данные которого не использовались в поиске. Выжившие механизмы: Action Fusion объединяет правку файла и её проверочную команду в одном вызове инструмента; Online Context Compact сжимает контекст на границах завершённых подзадач; ObservationPack архивирует большой вывод инструмента локально, оставляя в контексте стабильный хэндл с точной постраничной выборкой; Evidence-Preserving Reducer делегирует чтение длинных логов дешёвой модели, сверяя каждую цитату резюме с архивом. На EdgeBench с моделями GPT-5.6 Sol и Opus 5 связка сохраняет качество базового Pi, сокращая трафик токенов на 44.7–49.0% и API-расходы примерно на треть. Репозиторий NVlabs/SoL-Pi открыт под лицензией MIT с приглашением контрибьюторов к бенчмаркингу принятых PR.
Контекст
Обвязка — это среда вокруг модели: инструменты, управление контекстом и циклы выполнения. В длинных агентных прогонах контекст быстро раздувается выводами инструментов, и заметная часть бюджета уходит не на решение задачи, а на повторное чтение уже виденных данных. Auto-research и рекурсивное самоулучшение (RSI) традиционно считаются убыточными: циклы поиска улучшений расходуют больше токенов, чем приносят экономии, поэтому такие подходы оставались скорее исследовательской идеей, чем инженерной практикой. SoL-Pi строится поверх харнесса Pi 0.85.1 от Earendil Works и не меняет модель — все четыре выживших механизма относятся к системной инженерии обвязки. Выживаемость около одной гипотезы из сорока сама по себе информативна: подавляющее большинство «очевидных» идей улучшения агентов не проходит честную проверку. Держание EdgeBench вне поисковых данных — стандартная защита от подгонки улучшений под тестовый набор.
Почему это важно для индустрии
Главный результат для отрасли — не сами механизмы, а смена экономики авто-ресерча: обычно такие циклы убыточны, здесь же логика «перед масштабированием RSI заставь ИИ сделать сам ИИ дешевле» получила рабочий пример, где отбор улучшений окупился сокращением расходов на прогоны. Показан полный конвейер отбора улучшений обвязки с жёсткой изоляцией held-out-валидации и воротами против накрутки метрик, причём эффект переносится за пределы среды разработки и подтверждён на двух семействах моделей, GPT-5.6 Sol и Opus 5, что снижает риск подгонки под одну модель. Практически это готовый open-source шаблон экономии длинных агентных прогонов под MIT, оформленный как опциональное расширение харнесса Pi от Earendil Works, — агентные фреймворки могут перенять как отдельные механизмы, так и саму схему отбора с бенчмаркингом принятых PR. Если независимые замеры воспроизведут цифры, контекст-инжиниринг такого рода — компакция на границах подзадач, архивация наблюдений с хэндлами, дешёвое суммаризирование с верификацией — начнёт копироваться в мейнстримных харнесах, а «качество на доллар» встанет в один ряд с качеством как метрика конкурентоспособности.
Почему это важно для пользователей
Если вы гоняете кодинг-агентов часами, эффект заметен напрямую: по данным авторов, экономия достигает $8.75–13.50 в час против нативных Codex и Claude Code и $4.36–5.71 в час против базового Pi. SoL-Pi ставится поверх неизменённого Pi 0.85.1 (требуется Node.js 22.19+) командой pi install git:github.com/NVlabs/SoL-Pi, а механизмы включаются по одному в конфигурации sol-pi.json. Разумный порядок внедрения: сначала локальные Action Fusion и ObservationPack — они работают без дополнительных вызовов модели; затем Online Context Compact и Evidence-Preserving Reducer, но только после изучения SECURITY.md, поскольку редьюсер может отправлять содержимое логов внешней модели. Полученную экономию стоит сверять в собственной телеметрии, а не только на авторском бенчмарке.
Что пока неизвестно / ограничения
Все цифры пока получены самими авторами: независимой репликации на EdgeBench или аналогах нет. Продемонстрирована окупаемость в одном домене — автоматизации инженерии обвязки кодинг-агентов, поэтому обобщать это на «RSI теперь экономит больше, чем тратит» нельзя; строго говоря, это и не RSI, поскольку модель не улучшает сама себя, а улучшает свою обвязку. EdgeBench — авторский бенчмарк, и перенос результатов на другие модели, задачи и профили нагрузки требует проверки. Механизмы с делегированием дешёвой модели передают содержимое логов за пределы локальной среды, что стоит учитывать при работе с конфиденциальным кодом.
Источники
- SoL-Pi: Scaling Auto-Research Loops for Efficient Agent Harnesses (официальный блог NVIDIA Labs)
- SoL-Pi: Recursively Scaling Auto-Research Loops for Efficient Agent Harness (arXiv:2609.20519)
- NVlabs/SoL-Pi — официальный репозиторий (MIT)
Автор
Look at AI, редакция
