Microsoft представила Microsoft-Decision-1 — узкую decision-модель, построенную как пост-трейн поверх Qwen3.5-9B. Она не генерирует текст: за один проход модель выдаёт откалиброванные вероятности для фиксированного набора вариантов, и софту остаётся только принять решение. На 36 скрытых от обучения бенчмарках, покрывающих почти 150 тысяч вопросов, она показала лучшую точность среди LLM и других decision-моделей, а по заявленной задержке оказалась в 35 раз быстрее широкой генеративной модели GPT-6 Sol. Модель уже доступна в Microsoft Foundry, а страница с ценой открыта в каталоге OpenRouter.

image

Что произошло

Анонс опубликован в блоге Microsoft Command Line вместе с карточкой модели в каталоге и открытым API. Microsoft-Decision-1 решает четыре класса задач: ответ по схеме да/нет, выбор одного пункта из списка, рейтинг и рубричную оценку ответов языковых моделей и действий агентов; взамен текста софт получает вероятности по каждому варианту. По P50-задержке модель в 4,5 раза быстрее ближайшего конкурента Quyet-1.0-Large. Устойчивость решения проверялась возмущениями одного и того же запроса: при восьми видах искажений выбор меняется в среднем лишь в 1,3% случаев, а при перефразировании описаний вариантов, их перестановке и перемешивании решение не изменилось ни разу. По внутренним замерам Microsoft, команда Xbox Research разметила с моделью более 10 тысяч отзывов из опросов Steam и X с качеством уровня GPT-6 Sol примерно в 200 раз дешевле, а Copilot ускоряет такие решения в 100 раз при качестве уровня GPT-5.6 Luna. Стоимость вызова — $0,042 за миллион входных токенов, выходные токены бесплатны.

Контекст

Идея оценивать и классифицировать чужие ответы языковыми моделями — LLM-as-judge — известна давно: широкие модели годами применяют для маркировки, скоринга и модерации. Новизна Microsoft-Decision-1 не научная, а продуктовая: выходное пространство жёстко зафиксировано, поэтому модель отдаёт не текст, который нужно парсить, а вероятности, пригодные для прямого использования в коде. Сами decision-модели как категорию Microsoft размечает прямыми сравнениями с конкурирующими решениями и широкими генеративными моделями, выстраивая отдельное направление внутри Foundry. Ключевое обещание продукта — калибровка: если заявленная вероятность соответствует реальной частоте успехов, сервис может выставлять порог доверия и автоматически обрабатывать спорные случаи, не тратя дорогое суждение большой модели там, где достаточно дешёвого выбора из готовых вариантов.

Почему это важно для индустрии

Для отрасли событие фиксирует decision-модели как отдельный класс продуктов: API отдаёт сразу пригодные к использованию вероятности, а не текст для последующего разбора. Экономика изменения конкретна: агентные пайплайны выполняют десятки последовательных решений — маршрутизация, классификация, приоритизация, модерация, контроль действий агентов, и каждый вызов широкой LLM добавляет секунды задержки и доли бюджета. Узкая decision-модель решает те же задачи на порядки быстрее и дешевле, что обваливает себестоимость таких конвейеров и давит на маржу продуктов, чья прибыль держится на дорогих LLM-вызовах ради простых микрорешений. Microsoft обещает перебазировать модель на другие бэкбоны, включая MAI и OpenAI, и подключить её к GitHub Copilot для выбора между локальной и облачной обработкой — это сделает паттерн видимым для массового разработчика. Если заявления подтвердятся, стоит ожидать появления аналогов у других провайдеров и закрепления decision-слоя как стандартного узла агентных фреймворков и SDK.

Почему это важно для пользователей

Если вы собираете ботов, пайплайны разметки или агентные системы, задачу «выбери одно из N» теперь можно отдавать узкой модели за доли цента вместо вызова большой LLM. Из калиброванной вероятности в ответе строится «судья» агентных ответов: он показывает, когда решению можно верить без проверки, а когда нужен человек — это удобно для модерации, оценки ответов ИИ и выбора действий агентов, где поток решений слишком велик для ручного контроля. Практическое ограничение: выигрыш работает только там, где выход можно свести к фиксированному набору вариантов; свободную генерацию модель не заменяет. Разумный первый шаг — прогнать модель на собственной выборке в 100–1000 примеров против текущего бейзлайна, той же широкой LLM, и сравнить точность, стоимость и задержку на своих данных. Пилот при открытом API ставится за дни, а не за квартал.

Что пока неизвестно / ограничения

Все ключевые количественные показатели — лучшая точность на скрытых бенчмарках, выигрыши по задержке и стоимости, качество разметки в продакшене — это замеры самой Microsoft, независимой проверки пока нет, поэтому результаты стоит считать заявлением вендора. Сопоставление узкого 9B-классификатора с широкой генеративной моделью методологически неоднородно: у этих систем разный бюджет вычислений и разные типы выходов, поэтому корректная цифра в своей категории — сравнение с прямым конкурентом Quyet-1.0-Large. Калибровка — центральное обещание продукта, но в представленных материалах нет метрик вроде ECE, Brier или кривых покрытия и ошибки, так что главный продающий аргумент пока не подтверждён данными. Заявленная робастность тоже недоописана: не раскрыты число проб на каждый тип возмущения и критерий, по которому решение считается изменившимся. Наконец, в тексте самого Microsoft сказано «скоро на OpenRouter», тогда как страница с ценой уже открыта в каталоге — это расхождение стоит уточнить у вендора.

Источники

Автор

Look at AI, редакция