Сооснователь стартапа Freestyle Бен Свердлоу собрал открытый бенчмарк Brood War Bench: 19 конфигураций языковых моделей в агентных обвязках Codex, Claude Code и Grok сыграли каждая с каждой 171 матч в StarCraft: Brood War. Лидером стал Codex на модели Astra с максимальным уровнем рассуждений — 18 побед при нуле поражений при средней стоимости около 10,54 доллара за игру. При этом выше уровня новичка не поднялся никто: модели играли в стратегию в реальном времени как в пошаговую и погибали, пока думали.


Что произошло
Бенчмарк устроен как круговой турнир, где каждая конфигурация сыграла с каждой по одному разу. Первое место занял Codex на модели Astra с уровнем рассуждений xhigh, второе — та же модель на среднем уровне с 16 победами, третье — Claude Fable с 15, четвёртое — Astra на низком уровне с 14. Внизу таблицы результаты заметно слабее: три конфигурации Grok 4.6 в сумме взяли лишь три партии, а Claude Haiku не выиграл ни одной. Самый наглядный провал зафиксирован в матче G043: Grok 4.6 на xhigh за 43 минуты выдал 11 138 токенов рассуждений, отдал всего шесть пакетов команд и не построил ни одного боевого юнита. Записи всех матчей опубликованы, поэтому каждое такое падение можно разобрать по шагам.
Контекст
Brood War Bench — один из немногих открытых агентных бенчмарков в реальном времени, и в этом его главная ценность для оценки long-horizon-агентов. Среда живёт, пока модель рассуждает: цена ошибки здесь измеряется секундами, а не токенами, как в привычных пошаговых задачах. Агент действует через обвязку — Codex, Claude Code или Grok, — а уровень рассуждений модели (xhigh, medium или low) задаёт, сколько она позволяет себе размышлять перед каждым шагом. Автор проекта Бен Свердлоу — сооснователь стартапа Freestyle, который выпускает полноценные Linux-VM для AI-агентов, так что агентные обвязки для него повседневная работа. Важная рамка для чтения таблицы: соперниками конфигураций были только другие агенты, человека среди участников не было.
Почему это важно для индустрии
Для отрасли это редкий случай, когда агентный бенчмарк вскрывает конкретные слабости обвязок, а не «вообще слабость ИИ». Codex на Astra побеждал не макроигрой, а дизраптом: ранней отправкой рабочих бить вражеские постройки, пока соперник десятки секунд «думает», что делать. При этом его субагенты для экономики, производства и армии почти не координировались и отправляли юнитов в бой по одному. Claude Fable, единственный системно строивший экономику и дерево технологий — с выходом на Lair, Spire, Mutalisks и Robotics Facility, — занял лишь третье место: структурно правильная игра проиграла таймингу. Grok 4.6 провалился не в стратегии, а в самом цикле «наблюдай-действуй». Влияние уровня рассуждений оказалось немонотонным: Astra на xhigh (100%) сильнее Astra на medium (88,9%), но Sol на xhigh (61,1%) хуже Sol на medium (72,2%) и Sol на low (66,7%). Исход решают обвязка и экономика вызова: самый дешёвый сильный вариант — Codex 5.6 Luna/low с 50% побед всего за 0,42 доллара за игру, тогда как лидерский Astra/xhigh стоит около 10,54 доллара. Открытые записи 171 матча — готовый корпус отказов long-horizon-агентов для тех, кто строит оркестрацию субагентов и real-time циклы; деплоить такие циклы на этих конфигурациях в продакшн пока нельзя.
Почему это важно для пользователей
Разборы и записи всех матчей доступны на bw.swerdlow.dev/report, а запустить своего агента против перечисленных конфигураций можно на bw.swerdlow.dev — проект принимает сторонних участников. Для читателя это наглядный калибр ожиданий: агенты на топовых моделях — Codex на Astra, Claude Opus 5 с Fable, Grok 4.6 — реально ломаются в реальном времени на координации субагентов, таймингах атак и непрерывном наблюдении. Звание лидера такого турнира ещё не означает умения играть: все участники остались на уровне новичков. Чек-лист провалов из матчей — тайминги решений, координация субагентов, непрерывное наблюдение — применим к аудиту собственных агентных воркфлоу, потому что те же режимы отказа встречаются в любой среде, где мир меняется быстрее, чем модель успевает думать.
Что пока неизвестно / ограничения
Таблицу пока нельзя считать надёжным измерением силы моделей: у каждой конфигурации всего 18 игр, поэтому разрывы вроде 100% против 88,9% статистически неотличимы от шума, а в данных нет повторных серий, сидов и описания пула карт. Измеренного человеческого базлайна тоже нет — агенты играли только друг с другом. Есть и проблема атрибуции: конфигурации Grok 4.6 гонялись в своей обвязке, а факторного сравнения «одна модель в разных обвязках» и «одна обвязка с разными моделями» в данных нет, поэтому из одного турнира не следует, что провал Grok 4.6 «продуктовый» и «чинится в обвязке», как не следует и обратного. Немонотонное влияние уровня рассуждений может быть как шумом малой выборки, так и реальным трейд-оффом между длиной размышлений и дедлайном реального времени — это ключевой вопрос для проверки на большей выборке. Наконец, это исследовательский проект одного энтузиаста, а не продукт, и немедленного коммерческого эффекта у него нет.
Источники
- Brood War Bench — результаты, записи и разбор всех 171 матча
- Agent StarCraft — Brood War (сайт проекта, запуск своего агента)
- Ben Swerdlow (автор бенчмарка, сооснователь Freestyle)
Автор
Look at AI, редакция
