Ведущий научный сотрудник по alignment в Anthropic Эван Хьюбингер оценил в X вероятность гибели всего человечества от ИИ в ближайшие десять лет выше 10% — и подчеркнул, что это его личная оценка, а не официальная позиция компании. По его словам, текущие модели несут относительно низкий риск: тревога связана не с современными системами, а с гипотетическим суперинтеллектом, который может возникнуть в результате рекурсивного самоулучшения. Хьюбингер при этом признал, что готового решения для alignment суперинтеллекта у Anthropic сейчас нет и что отрасль движется не тем путём. Заявление стало ответом на публичный уход из компании исследователя Джейкоба Коксона, обвинившего frontier-лаборатории в том, что они рискуют жизнями людей, приближая самоулучшающийся суперинтеллект.

Что произошло
Публичный спор начался с постов Джейкоба Коксона (Jacob Coxon) — 27-летнего исследователя, который три года занимался препроцессингом в OpenAI и Anthropic и объявил об уходе из компании. В X он обвинил лаборатории в том, что они «гонятся прямо к самоулучшающемуся суперинтеллекту, рискуя нашими жизнями», и предположил, что «к концу следующего года всё уже может выйти из-под контроля». В ответ Эван Хьюбингер, возглавляющий направление Alignment Science в Anthropic, написал, что лично оценивает вероятность гибели всего человечества от ИИ в ближайшие десять лет выше 10% и что у компании «пока нет плана решить alignment для суперинтеллекта и мы не на верном пути». Эту переписку разбирают Forbes и Newsweek, которые обращают внимание: цифра — оценка одного из ключевых сотрудников по безопасности, а не позиция Anthropic.
Контекст
Значимость заявления определяется статусом говорящего. Хьюбингер — не внешний критик, а руководитель направления Alignment Science в Anthropic, то есть человек, который сам отвечает в одной из ведущих frontier-лабораторий за исследования того, как удержать под контролем всё более способные ИИ-системы. Центральное понятие спора — рекурсивное самоулучшение: режим, в котором ИИ значительно повышает собственный интеллект. Именно суперинтеллект, возникший таким путём, Хьюбингер считает источником главного риска; сегодняшние модели он, по его собственным словам, оценивает как относительно малоопасные. Разграничение принципиально: наблюдаемое поведение нынешних систем и гипотетический сценарий самоулучшающегося ИИ — разные уровни угрозы, но обе части этой оценки остаются личными суждениями исследователя, а не официальными заявлениями компании.
Почему это важно для индустрии
Для отрасли это редкий случай, когда внутреннюю оценку экзистенциального риска публично даёт действующий руководитель safety-направления ведущей лаборатории. Такой datapoint усиливает аргументы регуляторов и инвесторов в пользу независимых проверок препроцессинга frontier-лабораторий и финансирования safety-исследований. На этом фоне формируется спрос на отдельный рынок: независимый аудит, safety-инструменты и guardrail-паттерны для agent-воркфлоу смещаются из разряда «было бы хорошо» в разряд ожидаемых требований. Обратная сторона в том, что нарратив экзистенциального риска создаёт макро-подводные камни для всего AI-сегмента — от инвестиционного климата до роста скепсиса enterprise-клиентов, у которых появляются вопросы про safety и независимые оценки. Прямых технических изменений новость не несёт: ни новых моделей, ни изменений API, цен или латентности не анонсировано.
Почему это важно для пользователей
Читатель может напрямую прочитать первоисточники: ответ Хьюбингера опубликован в X под аккаунтом @EvanHub, а посты Коксона об увольнении — под аккаунтом @hilbertspaess. Это возможность увидеть, как сама индустрия формулирует риск, без пересказа СМИ. При цитировании цифры важно разделять личную оценку исследователя и позицию Anthropic, чтобы не приписывать компании то, чего она не заявляла. Для повседневной работы с нынешними моделями ничего не меняется: ни новых ограничений, ни новых продуктов не анонсировано. Если дискуссия продолжится, вероятнее фоновые эффекты: больше медиашума о рисках ИИ, больше вопросов о безопасности со стороны enterprise-клиентов и больше контрольных точек с участием человека в agent-продуктах.
Что пока неизвестно / ограничения
Главная оговорка: «более 10%» — экспертное мнение конкретного человека без опубликованной методологии, сценариев или данных о калибровке, поэтому как доказательство это суждение, а не воспроизводимый результат, и оно не является официальной позицией Anthropic. Тезис о том, что рекурсивное самоулучшение происходит «быстрее, чем ожидалось», — capability-заявление без приложенных доказательств: в источниках нет ни бенчмарков, ни оценок, ни ссылок на конкретные наблюдения. Утверждения Коксона о поведении лабораторий — его собственные обвинения, а не установленные факты. Наконец, независимые проверки frontier-лабораторий пока лишь предмет аргументов регуляторов и инвесторов, а не действующее регулирование: фактические изменения требуют отдельной проверки.
Источники
- Эван Хьюбингер (Alignment Science Lead, Anthropic) — пост в X
- Anthropic Researcher Quits, Warns AI Could Kill Everyone — Newsweek
- Anthropic alignment lead warns AI could kill all humans as researcher quits — Forbes
Автор
Look at AI, редакция
