18 августа 2026 года команда Ornith выпустила Ornith-1.5 — открытое семейство из трех моделей для программирования, логики и агентов. По данным разработчика, флагманская 397B-версия сравнима с закрытым Claude Opus 4.8 по агентским бенчмаркам, а все чекпоинты уже доступны для скачивания на Hugging Face.

image
image

Что произошло

В семейство Ornith-1.5 вошли три версии: плотная 9B, MoE-модель 35B-A3B, активирующая 3B параметров на токен, и MoE-флагман 397B. Ключевая механика — цикл self-improvement: модель сама генерирует задачи, пишет под них скэффолды (инструкции, инструменты, стратегию) и обучается на собственных попытках через GRPO, а отбираемые задачи валидируются по решаваемости, граничной сложности p* = 0.2 и новизне. По данным разработчика, Ornith-1.5-397B набирает 86.1 на Terminal-Bench 2.1 и 56.0 на DeepSWE, превосходя GLM-5.2 (82.7/46.2) и DeepSeek-V4-Flash-0731 (82.7/54.4) при результатах Claude Opus 4.8 на уровне 85.0/59.0. На SWE-Bench Verified версия 35B-A3B набирает 79.0 против 52.0 у Gemma 4-31B и 76.0 у Muse Glimmer-30B.

Контекст

Ornith-1.5 развивает Ornith-1.0, который был построен на Qwen3.5 и Gemma 4 с этапами CPT, mid-training и post-training, поэтому значительная часть агентной способности наследуется от базовых моделей, а не только от этапа self-improvement. Обозначение 35B-A3B означает, что из 35B общих параметров на каждый токен активно работают лишь 3B, что определяет эффективность инференса. Самоулучшение через обучение на собственных генерациях ранее встречалось преимущественно как эксперимент отдельных лабораторий, тогда как Ornith представляет его в виде задокументированного воспроизводимого пайплайна с формальными критериями отбора задач.

Почему это важно для индустрии

Ornith-1.5 поднимает открытые веса до уровня, сопоставимого с закрытым Claude Opus 4.8 по агентским бенчмаркам Terminal-Bench 2.1 и DeepSWE при полностью публичных чекпоинтах, что становится первым заметным открытым давлением на закрытые API. Цикл «модель генерирует задачи, пишет скэффолды, прогоняет rollout и обучается через GRPO» превращает self-improvement из маркетингового нарратива в воспроизводимый инженерный прием, который другие лаборатории смогут скопировать в собственных fine-tuning-пайплайнах. Если независимые evals подтвердят результаты 35B-A3B, формат «30-40B общих параметров при 3B активных» станет реальной self-hosted-альтернативой закрытым API для рутинных SWE- и терминальных задач: ниже цена за токен, а данные не покидают периметр. Также следует ожидать ускоренного насыщения SWE-Bench Verified и Terminal-Bench и появления новых агентских бенчмарков.

Почему это важно для пользователей

Все три чекпоинта можно скачать прямо сейчас на Hugging Face в форматах FP8, GGUF, MLX и NVFP4 при контексте 128K-256K, то есть под разные виды железа. Квантованные версии 9B (MLX/GGUF) запускаются на iPhone и Android, 35B-A3B с малым числом активных параметров подходит для self-hosted-развертывания, а 397B рассчитана на локальные серверы. На этой неделе можно прогнать собственные агентские и кодинг-задачи через Ornith-1.5 и сравнить с Gemma 4-31B, Qwen 3.6-35B и текущим API-поставщиком уже в своих условиях.

Что пока неизвестно / ограничения

Все бенчмарчные цифры являются self-reported данными разработчика: независимой верификации нет, API отсутствует, цен и данных по латентности не опубликовано. Тезис о паритете с Claude Opus 4.8 частичный: лидерство есть только на Terminal-Bench 2.1 (86.1 против 85.0), тогда как на DeepSWE Ornith-1.5-397B отстаёт (56.0 против 59.0). Абляций по этапам обучения нет, поэтому вклад базовых моделей Qwen3.5 и Gemma 4 отделить от вклада этапа self-improvement по имеющимся данным нельзя.

Источники

Автор

Look at AI, редакция