Исследователь Wes Sander опубликовал на arXiv работу о системе Discovery Loop, в которой LLM-агент эволюционирует алгоритмы оптимизации под контролем независимого математического верификатора. За один цикл система побил десять действующих рекордов базы Packomania в задаче упаковки кругов, а весь LLM-расход составил $27,72.

image

Что произошло

Статья с номером 2609.05093 (категория cs.AI) появилась на arXiv 4 сентября 2026 года. Система работает по простому принципу: эволюция начинается с простого seed-решателя, затем модель предлагает улучшения, опираясь на таблицу результатов и историю прошлых идей, каждый кандидат проверяется независимым верификатором, и только успешные изменения сохраняются, а адаптивный plateau-detection останавливает цикл, когда приросты перестают окупать затраты. На бенчмарке Packomania csqv, где нужно уложить N кругов переменного радиуса в единичный квадрат, максимизируя сумму радиусов, система улучшила лучшие известные решения для десяти значений N: 101, 102, 103, 105, 106, 107, 108, 109, 111 и 114, на 2,4–5,4% относительно прежних рекордов, потратив на весь цикл не более 15 итераций. Десять новых кандидатов независимо приняла сама база Packomania: в changelog за 2–4 сентября 2026 года они зафиксированы как полученные LLM-эволюционированным оптимизатором. Код системы опубликован под лицензией MIT в репозитории github.com/ucsandman/discovery-loop.

Контекст

Упаковка кругов — классическая задача комбинаторной оптимизации, а Packomania ведёт открытую таблицу лучших известных решений: фактически «рефери» здесь — не рецензент, а конкурентная community-база рекордов, где любое новое решение можно проверить независимо. Важно, что найденные варианты — не новая математика: LLM перекомбинирует известные оптимизационные примитивы — penalty L-BFGS-B, basin hopping на действующем решении, SLSQP-полировку по графу контактов — с точной параметризацией. Новизна результата — в автоматическом поиске и проверке: цикл «предложение LLM → независимая проверка → сохранение успеха» при цене порядка $2,77 за сломанный рекорд — воспроизводимый паттерн, а не разовый трюк.

Почему это важно для индустрии

Для отрасли это задокументированный и внешне верифицированный пример того, что LLM-агент способен автономно генерировать проверяемые улучшения в классической оптимизации, а не только писать код по запросу разработчика. Механизм с независимым верификатором и plateau-detection резко снижает порог входа в автоматизированное исследование оптимизационных задач: не нужны ни большой вычислительный бюджет, ни месяцы ручной работы. Репозиторий уже содержит плагины для MIPLIB, CVRP и электрических сетей — автор помечает их как unvalidated, но сама плагинная структура задаёт дорожную карту: если другие группы воспроизведут схему на этих доменах с внешней валидацией, «LLM-гиперхэвистика» с независимым чекером может стать стандартным инструментом поиска новых решений. Сейчас это не сервис: API, pricing и SLA нет, латентность не заявлена.

Почему это важно для пользователей

Для читателя результат полезен прямо сейчас: статья объёмом 8 страниц доступна на arXiv под лицензией CC BY 4.0, а репозиторий можно склонировать и развернуть под свою оптимизационную задачу — достаточно своей целевой функции и быстрого независимого верификатора. Свежие рекорды видны вживую на странице Packomania csqv, а в папке best/ репозитория лежат .pck-файлы с принятыми решениями, так что геометрию каждой упаковки можно проверить самостоятельно. По сути это готовый open-source шаблон цикла «LLM + верификатор», на котором можно потренироваться в агентном поиске в пространстве алгоритмов за копейки LLM-расхода.

Что пока неизвестно / ограничения

Источники не указывают идентификатор и версию использованной LLM. Нет ablation-эксперимента — того же цикла без LLM, — нет baseline с человеком-экспертом или обычным эволюционным поиском, а также описаний повторных запусков, поэтому устойчивость результата к случайности оценить нельзя. Внешняя валидация пройдена только для circle packing: плагины MIPLIB, CVRP и электрических сетей прямо помечены автором как unvalidated, а производственные характеристики системы — латентность, стабильность прогона, стоимость на других доменах — не заявлены.

Источники

Автор

Look at AI, редакция