Пользователь @cozyblazex опубликовал в X эксперимент, в котором модель GPT-6 Astra (gpt-6-astra) в режиме максимального ризонинга полностью прошла оригинальную Portal: по опубликованному логу от старта до титров прошло 23 часа 42 минуты 34 секунды. Каждый шаг прогона, весь учёт токенов и разбор стоимости открыты для проверки, а само прохождение снято на видео.

Что произошло
Старт эксперимента зафиксирован 4 сентября 2026 года в 17:00 PDT, титры — 5 сентября в 16:43 PDT; хронометраж включает переключения после capacity-ошибок, сессию автор перезапускал и доигрывал в Fast-режиме. Модель управляла Челл через MCP-сервер и модифицированную сборку SourcePauseTool, а на каждый ход ей поступали скриншот, позиция персонажа и угол камеры. Из 3300 вызовов инструментов 3210 — команды portal_exec, то есть модель в основном действовала, а не описывала намерения. По санированному логу прогон потребовал 434,8 млн токенов: 433,2 млн входных, из них 426,4 млн (около 98%) попали в кэш, и 1,6 млн выходных, из которых 1,18 млн (около 74%) — токены рассуждений.
Контекст
Portal — оригинальная головоломка 2007 года, и её интерактивный 3D-мир удобен как среда с объективной конечной целью: пройти игру до титров. При этом модель не имеет доступа к полному внутреннему состоянию игры и опирается только на то, что ей показывают через инструменты. MCP — протокол, по которому frontier-модель вызывает внешние инструменты и получает данные из среды; в эксперименте он связывает Astra с игровым процессом. Решающая деталь сетапа — модифицированная сборка SourcePauseTool, которая ставила игру на паузу, пока Astra рассуждала: ограничение реального времени снято, и агент имел фактически неограниченное время на каждый ход. Проверке здесь подлежит long-horizon агентность — способность удерживать одну цель часами в цикле «наблюдение — планирование — команда», — а не скорость реакции.
Почему это важно для индустрии
Для индустрии это первый широко публичный случай, когда frontier-модель почти сутки автономно удерживала одну цель в интерактивной 3D-среде с открытым логом и точным токено-учётом, а не маркетинговое видео. Главный ориентир — экономика: по прайсу API ($10/млн входных, $50/млн выходных, $1/млн кэшированных) гипотетическая стоимость прогона без кэша — около $4400, а с кэшированием входных токенов — около $574, срез примерно в 8 раз, и весь прогон укладывается в подписку Codex за $200/мес без оплаты по API-прайсу. Для команд это готовый порядок величин для агентных бюджетов, а открытый репозиторий даёт переиспользуемую архитектуру — MCP-контроллер, патч SourcePauseTool и цикл «скриншот — команда», которую можно переносить в другие среды.
Почему это важно для пользователей
Пользователю есть что посмотреть и что повторить: видео прохождения, санированный лог каждого шага и полный сетап — контроллер, патч SourcePauseTool и инструкция под Windows. Практический вывод, применимый уже в собственных проектах: кэширование входных токенов — главный фактор, который делает многочасовые агентные прогоны рентабельными, а подписочные планы могут заменять оплату по API-прайсу. Для воспроизведения достаточно опубликованного репозитория и машины под Windows, а по санированному логу можно разобрать, что именно модель делала на каждом шаге.
Что пока неизвестно / ограничения
Это одиночный прогон (N=1) в одной среде без повторов, без сравнения с другими моделями и без статистики ошибок, поэтому это демонстрация, а не валидный бенчмарк. Оценка в $574 — гипотетическая стоимость по публичному прайсу API, а не реальный платёж. Прогон не является работой в реальном времени: среда стояла на паузе во время рассуждений, а хронометраж включает переключения после capacity-ошибок, перезапуск сессии и доигровку в Fast-режиме. Это пользовательский эксперимент, а не релиз, API-изменение или готовая к продакшену система.
Источники
- cozyblazex на X: оригинальный пост и тред о проходе GPT-6 Astra
- Репозиторий cozyblaze/portal-agent: контроллер, патч SourcePauseTool, санированный лог и evidence/summary.json
- GPT-6 Astra Plays Portal — видео прохождения на YouTube
Автор
Look at AI, редакция
