Poobesh Gowtham опубликовал arc-skill — скилл для Claude Code на Claude Opus 5, который закрыл все 25 публичных игр ARC-AGI-3 с потолочным счётом 100.00 RHAE, а результат официально верифицирован ARC Prize Foundation. Модель не дообучали: результат дал скилл, который превращает каждое действие агента в проверяемый эксперимент с журналом.

image
image

Что произошло

Скилл состоит из файла инструкций SKILL.md на 129 строк и CLI-инструмента на 4343 строки, в которых ни разу не упоминается ни одна из 25 игр. Механика сводится к одному правилу: перед каждым действием модель формулирует фальсифицируемое предсказание того, что изменится на сетке, — в одной из 8 форм, например cell X,Y=V, move, level+1, — а харнес отклоняет действие без предсказания и сверяет его с реально вернувшимся кадром. За кампанию модель прошла 183 из 183 уровней за 7645 действий и написала 7627 предсказаний, из которых 443 промахнулись. Официальной записью результата стал scorecard 24ddb219, опубликованный 13 августа 2026; все нажатия были проиграны через серверы ARC.

Контекст

Публичный срез ARC-AGI-3 состоит из 25 игр, счёт в нём измеряется в RHAE, а медиана человека на этом срезе — 17135 действий. На этом фоне ключевой факт: без скилла та же Claude Opus 5 набирает на том же бенчмарке лишь 30.16%, так что разрыв до потолка шкалы закрыл харнес, а не модель. Прогон не похож на «поняла с первого раза»: одиночные тестовые действия ошибались в 37.1% случаев, а действия внутри сформированного плана — лишь в 2.9%, то есть агент выучил правила игры на собственных промахах, и успех держится на бюджете итераций. В 24 из 25 игр агент применял офлайн-Python для вычислений (1727 вызовов), так что значимая часть результата — это работа модели в коде, а не чистое зрительное рассуждение.

Почему это важно для индустрии

Для отрасли это верифицированный воспроизводимый образец скилл-инжиниринга — упаковки tool use и протокола в файл навыка — как практического test-time-альтернативы дообучению и промпт-инжинирингу для задач со строгим форматом вывода: цена скилла и харнеса многократно ниже цены переобучения модели. Одновременно публичный лидерборд ARC-AGI-3 фактически перестал ранжировать агентов: после верифицированного потолка на публичном срезе осмысленное сравнение возможно только на приватных задачах, и оценка бенчмарка, вероятно, сместится в закрытые или ротационные наборы.

Почему это важно для пользователей

Паттерн predict before act переносится на собственного агента без изменения модели: добавить в цикл агента шаг, где модель фиксирует предсказание до действия, затем получает автоматическую проверку по реальному результату и журнал ошибок, — это превращает блуждание агента в эксперимент с проверяемым исходом. Сам arc-skill ставится одной командой npx skills add pbshgthm/arc-skill; требуются ARC_API_KEY и Python 3.12+. Журнал предсказаний и промахов харнеса — готовый датасет для evals и observability, полный разбор с транскриптами всех прогонов — на arc-skill.vercel.app, верифицированные реплеи всех 25 игр — в scorecard на arcprize.org.

Что пока неизвестно / ограничения

Доказательная база узкая: один бенчмарк (публичный срез ARC-AGI-3), одна модель (Claude Opus 5), один скилл, и нет ни head-to-head сравнения с RL или дообучением, ни оценки на других бенчмарках, поэтому обобщение, что скилл-инжиниринг стал конкурентом переобучения, — это одна точка данных, а не закономерность. Результат — верифицированное демо на закрытом публичном срезе, а не production-сервис: данных по цене и задержкам нет, закладывать паттерн в production-бюджет пока нельзя. Потолочный счёт достигнут на публичных играх и не гарантирует переноса на другие задачи и бенчмарки.

Источники

Автор

Look at AI, редакция