Anthropic выпустила Claude Sonnet 5.5 — вторую после Opus 5.5 модель линейки 5.5, рассчитанную на чётко поставленные повседневные задачи: правку багов, работу с документами, презентациями и таблицами. Компания позиционирует новинку как более быстрое и дешёвое в работе дополнение к флагману, при этом тариф остался на уровне Sonnet 5. В независимом замере рабочих задач модель практически сравнялась с Opus 5.5, а в агентном программировании в командной строке его обошла. Попробовать Sonnet 5.5 можно уже сейчас — в приложениях Claude, через API и у крупных облачных провайдеров.

image

Что произошло

Anthropic выпустила модель среднего класса и сопроводила релиз собственными замерами и независимой оценкой. По данным компании, Sonnet 5.5 генерирует ответ более чем на 30% быстрее Sonnet 5 и обходится до 30% дешевле за задачу за счёт меньшего расхода токенов. В Terminal-Bench 4.0, проверяющем агентное программирование в командной строке, модель набрала 70,6% против 10,3% у Sonnet 5 и 66,4% у Opus 5.5. В OSWorld 2.1, который оценивает управление компьютером, она показала 80,1% против 57% у Sonnet 5 и 81,8% у Opus 5.5. В GDPval-AA — замере рабочих задач из 44 профессий, проведённом Artificial Analysis, — Sonnet 5.5 набрала 1844 балла против 1846 у Opus 5.5 и 1449 у Sonnet 5. Модель работает под идентификатором claude-sonnet-5-5 и доступна в приложениях Claude, через API, а также в AWS, Google Cloud и Microsoft Azure по прежним ценам: $2 за миллион входных токенов, $10 за миллион выходных и $0,20 за миллион чтений из кэша.

Контекст

Релиз достраивает линейку 5.5, которую Anthropic начала с флагмана Opus 5.5, а обещанный в ближайшие недели Haiku 5.5 должен закрыть дешёвый сегмент высоконагруженных сценариев. Замысел серии — развести модели по ролям: Haiku для массовых недорогих задач, Sonnet как основная рабочая модель, Opus для самых сложных случаев. Второй пласт контекста — устойчивое сближение среднего класса с флагманами, из-за которого выбор модели всё чаще определяется не доступом к лучшей модели, а ценой и типом задачи. Показательна и структура доказательной базы: ключевую цифру о почти полном паритете в рабочих задачах дала не сама Anthropic, а независимая Artificial Analysis, что делает её весомее обычных заверений вендора.

Почему это важно для индустрии

Sonnet 5.5 фактически закрывает разрыв между средним и топовым классом: почти уровень Opus 5.5 в рабочих задачах и выше него в Terminal-Bench 4.0 при вдвое более низкой цене входных токенов ($2 против $4 за миллион). Для строителей продуктов это редкий случай, когда средний класс догоняет флагман без смены вендора и без роста цен: чётко поставленные шаги агентных пайплайнов — CLI-кодинг, правки багов, документы, презентации, таблицы — можно перевести на claude-sonnet-5-5 почти без потери качества, оставляя Opus 5.5 только для тяжёлых шагов. Такое соотношение цены и качества давит на ценовую политику конкурентов и закрепляет многоуровневую маршрутизацию моделей как типовую архитектуру инференса. Отдельный прецедент касается безопасности: по System Card это первый Sonnet с кибер-защитой уровня Opus 5, переадресацией повышенно-рисковых запросов на Sonnet 5 и классификаторами против дистилляции, то есть защитные механизмы впервые масштабированы с флагмана на массовую модель. Выход Haiku 5.5 в ближайшие недели достроит трёхуровневую лестницу тарифов и потребует перенастройки роутинга в агентных продуктах.

Почему это важно для пользователей

Пользоваться моделью можно уже сейчас: в приложениях Claude, через API и в AWS, Google Cloud и Azure, причём тариф остался прежним, а отклик стал заметно быстрее. Рутинные задачи — правку багов, подготовку документов, презентаций и таблиц — имеет смысл переводить на Sonnet 5.5 с Sonnet 5 или частично с Opus 5.5, чтобы снизить расходы на типовых операциях почти без потери качества. Тем, кто строит сервисы на дешёвых моделях, стоит следить за обещанным Haiku 5.5: он нацелен на высоконагруженные сценарии и может стать ещё более дешёвым вариантом для массовых запросов. Из любопытного: Sonnet 5.5 впервые среди моделей Sonnet прошла Pokémon Red, ориентируясь только по скриншотам экрана, что наглядно показывает, насколько продвинулось управление компьютером по изображению.

Что пока неизвестно / ограничения

Корректнее говорить не о доказанном паритете с Opus 5.5, а о разрыве в два балла GDPval-AA: доверительные интервалы и разброс результатов не опубликованы. Сам замер прошёл на предрелизной версии с багом в структурированном выводе, поэтому финальные цифры для релизной сборки могут отличаться. Результат Terminal-Bench 4.0 методологически самый спорный: семикратный скачок внутри линейки за одно поколение нетипичен, в источниках упомянут «лучший уровень усилий» для Opus 5.5, но полные условия — версия агентного харнесса, число прогонов, критерии успеха — не раскрыты. Ключевые цифры пока опираются на отчёт вендора и единичный независимый замер, так что выводы о паритете стоит перепроверять по накопленным за ближайшие месяцы независимым тестам. Наконец, Haiku 5.5 только обещан, и его характеристики и сроки останутся неопределёнными до официального анонса.

Источники

Автор

Look at AI, редакция