Коллектив dunnolab под руководством Владислава Куренкова (AIRI) открыл сообщество NetHackers, цель которого — создать первую программу, которая стабильно выигрывает в NetHack 3.6.6. Побеждать в этой игре 1987 года значит довести персонажа примерно через пятьдесят процедурных уровней до Amulet of Yendor, не погибнув: смерть здесь перманентна. Оценка ботов построена на сетке из 73 стартовых идентичностей, где публичные сиды воспроизводятся локально, а скрытые пересчитываются независимо у организаторов. Стартовый харнесс заставляет Claude Code, Codex или OpenCode эволюционировать символьного бота по принципу MAP-Elites, и подключиться к усилию можно с обычного ноутбука.

Что произошло
Ядро запуска — работоспособная оценочная инфраструктура. CLI, который ставится командой uv tool install nethackers, оценивает ботов на сетке из 73 стартовых идентичностей role-race-align-gender: 15 публичных сидов участник воспроизводит локально, а ещё 15 скрытых сидов независимо пересчитываются у организаторов на закреплённом linux/amd64-образе. Тонкий хаб хранит лучшие «элитные» боты по каждой цели, и любой участник может скачать чужую программу по точному коммиту, улучшить и перерегистрировать её. Стартовый харнесс реализует эволюцию в духе MAP-Elites: Claude Code, Codex или OpenCode за одну итерацию вносят одно фокусное изменение в bot.py, и алгоритм оставляет только те правки, которые улучшили результат. При этом LLM работает офлайн, исключительно на этапе эволюции, а в рантайме в NetHack играет дешёвая символьная программа с полностью аудируемым кодом; репозиторий dunnolab/nethackers открыт под лицензией Apache-2.0.
Контекст
NetHack — классический roguelike 1987 года, который давно служит эталонным бенчмарком длинного горизонта: победа требует провести персонажа через десятки процедурно генерируемых уровней до Amulet of Yendor, а любая ошибка означает перманентную смерть. В наборе BALROG это худшая игра для frontier-моделей, и соавтор NLE Тим Роктяшель ежегодно напоминает, что «AI всё ещё не научился играть в NetHack». Уровень техники к моменту запуска скромный: символический AutoAscend 2021 года давал 7.8% прогрессии, RL-агент 2026 года — 16.98%, а единичная победа LLM-агента GPT-6 «Astra» на версии 3.6.7 заняла 37 140 ходов и 12 дней под присмотром человека; стабильных побед нет ни у одного подхода. По отдельности компоненты проекта не новы — MAP-Elites, эволюция программ и LLM как оператор правки кода уже описаны в исследованиях; новизна в другом: это открытая арена с реестром элитных ботов, привязанных к точным коммитам, где чужие наработки можно скачивать, улучшать и перерегистрировать.
Почему это важно для индустрии
Для индустрии проект — публичная проверка ключевого паттерна агентного кодинга: модель, которая сама не решает задачу, пишет программу, которая решает. Проверка идёт не по self-reported результатам, а с независимой перепроверкой на скрытых сидах, то есть это честный тест на генерализацию, а не подгонку под известные сиды. Инженерам интересна и экономика схемы: дорогой поиск при разработке, почти нулевая стоимость инференса в игре и полностью аудируемый артефакт; набор методов — закреплённый образ, скрыто-сидовая верификация, реестр форков по коммитам — можно копировать в собственных проектах уже сегодня. Если в ближайшие месяцы элитные боты заметно превысят отметку около 17% прогрессии на скрытых сидах, это будет первый сигнал, что LLM-управляемая эволюция кода генерализует на длинном горизонте. В более длинной перспективе связка «LLM пишет, символьная программа играет» способна стать стандартным маршрутом для задач, где LLM на каждом шаге слишком дорог или недетерминирован, а в случае неудачи NetHackers останется эталонным негативным результатом о планировании на длинном горизонте.
Почему это важно для пользователей
Участвовать можно с обычного ноутбука: команда nethackers setup ставит рантайм и песочницу объёмом около 1 ГБ, после чего публичный скор воспроизводится локально. Эволюция собственного бота запускается одной командой — nethackers evolve --operator codex, причём оператором может выступать Claude Code, Codex или OpenCode. Собственные боты и собственные харнессы приветствуются: участник не обязан следовать стартовому MAP-Elites-пайплайну. Каждая зарегистрированная программа фиксируется по точному коммиту и остаётся в хабе, поэтому чужого элитного бота можно взять за основу, улучшить и перерегистрировать — так наработки одного человека становятся стартовой точкой для других. Издержки участия сводятся к времени, стоимости ноутбука и токенам оператора, а практическая ценность на сегодня не в победе в игре, а в доступном полигоне для отладки собственных агентных пайплайнов.
Что пока неизвестно / ограничения
Побед пока нет: на старте у сообщества есть инфраструктура, но нет результата, а ориентиры для сравнения — 7.8% прогрессии у AutoAscend и 16.98% у RL-агента. Единичная победа GPT-6 «Astra» получена на версии 3.6.7 за 12 дней с присмотром человека, что не эквивалентно стабильной победе. Оценки на полгода и два года — интерпретации, а не гарантии: неизвестно, превысят ли элитные боты текущий уровень на скрытых сидах и наберёт ли сообщество критическую массу. Схему не стоит автоматически переносить в корпоративную приёмку: NetHack — детерминированная открытая среда с бинарным счётом и закрепляемым образом, тогда как корпоративные агентные задачи обычно не имеют ни такой закрепляемости, ни ground truth. Наконец, это исследовательская инфраструктура без API, SLA или цены, поэтому о каком-либо продакшен-эффекте говорить преждевременно.
Источники
- NetHackers — лендинг проекта dunnolab: открытое усилие создать первую программу, стабильно выигрывающую в NetHack 3.6.6
- dunnolab/nethackers — GitHub-репозиторий сообщества (лицензия Apache-2.0)
Автор
Look at AI, редакция
