Стюарт Расселл, профессор computer science в UC Berkeley и президент International Association for Safe and Ethical AI, опубликовал в The Guardian колонку с критикой предложения Dario Amodei, CEO Anthropic, развивать frontier-модели в режиме «paced» — на сниженной скорости под общими стандартами. Расселл называет такой подход глубоко ошибочным и предлагает аналог авиационной сертификации: модель с новой возможностью должна выпускаться только вместе с сертификатом на соответствующие свойства безопасности. От ответа на этот аргумент зависит, как в дальнейшем будет выглядеть допуск frontier-моделей на рынок.

Что произошло
Поводом для колонки стало письмо «We Must Pace the Frontier» объёмом около 3800 слов, написанное Dario Amodei и поддержанное Сэмом Альтманом, Илоном Маском, Демисом Хассабисом и Сатьей Наделлой. В письме Amodei использует метафору машины безопасности в Formula 1: компании продолжают разработку на сниженной скорости, выигрывая время для проверки безопасности, со сторонними аудиторами внутри каждой лаборатории и общими стандартами для «демократических стран». Расселл в колонке для The Guardian отвергает эту логику и приводит противоположную аналогию: как Boeing не выпускает самолёт, пока тот не пройдёт все испытания и не получит сертификат лётной годности, так и модели с возможностью X должны выходить только вместе с сертификацией соответствующих свойств. Отдельно он обращает внимание, что Amodei в собственном письме фактически согласился с логикой red lines, использовав формулировку «certifications of alignment properties Y and Z».
Контекст
Спор Расселла и Amodei идёт не о скорости разработки как таковой, а о точке допуска модели на рынок: «pace car» в Formula 1 против «red flag» с предварительной сертификацией. Согласно приведённым в колонке числам, руководители ИИ-лабораторий сами оценивают риск катастрофы как 1 к 10 — 1 к 5, тогда как общепринятый приемлемый уровень потери контроля — порядка 1 на 100 млн в год; такой разрыв в несколько порядков делает текущую практику release-решений необоснованной даже без ссылок на регулирование. При этом пока это публичная полемика, а не регуляторное требование: колонка и письмо — аргументы, а не стандарты, и они не меняют ни правила, ни закупки. В материале упоминается возможное «окно изменений» вокруг саммита Трампа и Си как сценарий, при котором дискуссия могла бы перерасти в конкретные стандарты; это предположение, а не установленное событие.
Почему это важно для индустрии
Колонка меняет рамку спора о регулировании: вместо «замедлиться, чтобы выиграть время» предлагается жёсткая модель допуска на рынок, где безопасность является предварительным условием выпуска модели, а не исследовательской программой на фоне гонки. То, что сторонник «paced»-подхода сам допустил формулировку о сертификации свойств выравнивания, даёт регуляторам и лабораториям готовую точку опоры для требований о приостановке релизов, не соответствующих стандартам. Если сценарий сертификации хотя бы частично реализуется, релиз модели подорожает и замедлится для всех, но налог ляжет непропорционально на стартапы: им придётся содержать комплаенс-команды и проходить внешние аудиты при более короткой дистанции до кассового разрыва. Параллельно формируется контур будущего спроса на инструменты соответствия — eval-наборы под конкретные свойства, аудит-трейлы и отчётность для сторонних аудиторов, по аналогии с тем, как регуляторные требования к данным породили индустрию privacy-инструментов.
Почему это важно для пользователей
Прямых продуктовых изменений спор пока не приносит: это регуляторная полемика, а не релиз функции, поэтому ни serving, ни latency, ни стоимость инференса от неё не меняются. Для ML-исследователей, работающих с evals и выравниванием, важен сам вектор: если сертификационная рамка дойдёт до практики, именно она определит, какие измерения станут обязательными и кто будет признавать их результаты, а safety evals превратятся из исследовательской практики в сертификационный артефакт с юридической силой и внешними аудиторами. Разумное действие сейчас дешёвое: провести инвентаризацию покрытия evals, логирования и воспроизводимости релизов, а также заложить в роадмап опциональный модуль аудит-готовности — логирование решений агентов и воспроизводимые eval-отчёты — не превращая его в обязательный слой. Рамка «сертификация вместо paced» уже сейчас пригодна как аргумент в переговорах с enterprise-клиентами и в позиционировании safety-продуктов.
Что пока неизвестно / ограничения
Главный недостаток обеих позиций — отсутствие методологии: ни в письме, ни в колонке нет методики измерения свойств Y и Z, и в источнике нет ни одного свидетельства, что стандартизированные, воспроизводимые и устойчивые к геймингу evals для «alignment properties Y and Z» вообще существуют. Возражение касается и самой авиационной аналогии: сертификация самолётов работает потому, что опирается на набор стандартизированных, физических, воспроизводимых испытаний, а перенос этой модели на свойства выравнивания без таких методик остаётся риторикой. Открытыми остаются и операционные вопросы: какие именно свойства сертифицировать, какие пороги считать достаточными, кто будет аудировать и как обеспечить независимость аудиторов. Наконец, резонанс обсуждения на момент публикации был низким — на Hacker News дискуссия набрала 2 балла и 0 комментариев, — поэтому не стоит переоценивать текущий общественный вес спора.
Источники
- The Guardian — колонка Стюарта Расселла «AI safety requires more than just slowing our pace»
- Hacker News — обсуждение колонки
Автор
Look at AI, редакция
