12 сентября 2026 года сооснователь и CEO Anthropic Дарио Амодеи опубликовал эссе We Must Pace the Frontier, в котором призвал целенаправленно замедлить рост возможностей фронтир-моделей, чтобы безопасность и аудит успевали за разработкой, и объявил, что Anthropic берёт на себя одностороннее обязательство предоставить независимым проверяющим постоянный доступ «employee-level» к системам компании.

image
image
image

Что произошло

В эссе Амодеи изложил трёхступенчатый план. Первый шаг — встроенные проверяющие (embedded evaluators): сторонние эксперты получают постоянный доступ «employee-level» не только к готовым моделям, но и к процессу обучения, чтобы проверять меры безопасности, расследовать инциденты и оценивать alignment прямо во время обучения моделей. Второй шаг — координация лабораторий в демократических странах с общими стандартами безопасности. Третий шаг — международная координация и нормы. По словам Амодеи, ИИ уже ускоряет создание следующего поколения моделей, то есть рекурсивное самоулучшение началось, а в горизонте 6-12 месяцев более мощный рой агентов теоретически смог бы развернуть устойчивый ботнет и нанести ущерб на сотни миллиардов долларов. Заявление быстро подхватили: Сэм Альтман заявил, что OpenAI поступит так же, Hugging Face направила запрос о вступлении в программу embedded evaluators, а реакции последовали и от других участников рынка, включая Илона Маска.

Контекст

Материал стоит читать не как анонс продукта: здесь нет ни новой модели, ни API, ни бенчмарка — это сдвиг в практике аудита, при котором внешний аудит впервые расширяется от готовых моделей к самому процессу обучения. Трёхступенчатая рамка расширяет собственную Responsible Scaling Policy (RSP) компании с уровнями AI Safety Levels (ASL): внутренний механизм оценки риска темпов развития переносится за пределы Anthropic и предлагается как общий для отрасли и стран. Отдельный контекст — смена позиции самого Амодеи: ещё в 2023 году замедление разработки он считал преждевременным, а теперь аргументация «pace» строится на внутренних оценках темпа роста возможностей, которые компания не раскрывает. Непрерывные оценки и наблюдаемость в процессе обучения давно являются стандартным подходом надёжной ML-эксплуатации, и Anthropic фактически выносит этот подход из внутренних процессов в публичный формат.

Почему это важно для индустрии

Для отрасли это первый институционализированный прецедент: лидер рынка открывает внешним проверяющим постоянный доступ к процессу обучения, а не только к готовым моделям, превращая безопасность из внутреннего документа в проверяемый процесс. Если обещания OpenAI и запрос Hugging Face перерастут в конкретику, формат «employee-level» доступа может стать отраслевым стандартом и основой для регулирования, а аудит процесса обучения станет такой же нормой, как проверка готовых моделей. Сильный сигнал уже сейчас даёт рынку инструментов: команды, занимающиеся evals, red teaming и инцидентными отчётами, получают возможность позиционироваться как кандидаты в embedded evaluators или вендоры инструментов внешнего аудита, а при конкретизации программ ожидаются публичные спецификации — границы доступа, процедуры публикации выводов, ограничения на защищённую информацию — и вокруг них может сформироваться рынок «аудит-как-сервис» со стандартизированными форматами finding и дашбордами состояния процесса обучения. Прямых коммерческих эффектов сегодня нет, поскольку это эссе и одностороннее обязательство, а не контракт, стандарт или регулирование; если же pacing примут, циклы выпуска моделей станут длиннее и предсказуемее.

Почему это важно для пользователей

Для пользователей и читателей прямых технических изменений нет: в заявлении нет ни API, ни цен, ни данных о латентности — это политическое и организационное заявление, а не продукт. Практический смысл в другом. Во-первых, это редкий случай, когда глава крупной лаборатории открыто признаёт, что рекурсивное самоулучшение моделей уже началось, и называет конкретный горизонт риска: 6-12 месяцев для сценария масштабной кибератаки роем агентов. Во-вторых, если программа заработает, независимые эксперты смогут публиковать неудобные выводы о безопасности передовых моделей, и именно их первые отчёты станут реальной проверкой того, действительно ли обещанный доступ работает. В-третьих, эссе задаёт карту будущего регулирования ИИ — от внутренних проверок и координации демократических стран до международных норм, — по которой читателю проще понимать, куда движется контроль над фронтир-моделями.

Что пока неизвестно / ограничения

Заявления о том, что рекурсивное самоулучшение уже началось, и сценарий устойчивого ботнета с ущербом на сотни миллиардов долларов — это оценки самого Амодеи, а не воспроизводимые результаты: методологии, внутренние данные и расчёты в источниках не раскрываются. Технический протокол программы, состав проверяющих и критерии оценок не опубликованы, а операционная связь между уровнями AI Safety Levels и действиями внешних проверяющих в источниках не описана. Пока неясно, будет ли доступ фактически предоставлен и не будет ли фильтроваться публикация выводов: эту проверку дадут первые независимые отчёты. Также неясно, как именно будут конкретизированы обещания OpenAI и запрос Hugging Face.

Источники

Автор

Look at AI, редакция