Группа примерно из 33 исследователей, среди которых Jason Weston, Anirudh Goyal и Jakob Foerster, опубликовала на arXiv статью «AI Research Preference Models» (arXiv:2608.13940). В ней предложен Research Preference Model (RPM) — ступень отбора, которая из пятнадцати сгенерированных вариантов решения выбирает самый перспективный до полного GPU-запуска, вместо того чтобы тратить часы GPU на каждый. На бенчмарке AIRS-Bench внутри агентного каркаса AIRA-dojo такой отбор поднял среднюю нормализованную оценку с 0.684 до 0.729 и позволил тратить почти на треть меньше вычислений.

image

Что произошло

Препринт «AI Research Preference Models» вышел на arXiv: версия v1 появилась 14 августа 2026 года, версия v2 — 25 августа 2026 года; работу подготовили около 33 авторов, включая Jason Weston, Anirudh Goyal и Jakob Foerster. Предложенный Research Preference Model (RPM) — ступень отбора перед дорогой верификацией: агент генерирует пятнадцать вариантов решения, а RPM через попарные сравнения выбирает одного победителя, который один и доходит до полного GPU-запуска. Inference-only вариант опирается только на рассуждение LLM над планами, кодом и прошлыми экспериментами; agentic вариант дополнительно проводит дешёвые пилотные запуски длительностью 5 минут, 30 минут и 4 часа и учитывает их метрики. Проверка шла на 20 задачах AIRS-Bench (языковое моделирование, математика, биоинформатика, временные ряды) внутри агента AIRA-dojo: средняя нормализованная оценка выросла с базовых 0.684 до 0.711 у inference-only и до 0.729 у agentic версии.

Контекст

У автономных ИИ-исследователей узкое место сместилось от генерации идей к их верификации: придумать много вариантов дёшево, а каждая полноценная проверка требует часов GPU. Итог агента поэтому определяет не богатство идей, а то, как он распределяет фиксированный бюджет запусков. Статья отвечает на это каскадом «рассуждение, затем дешёвый пилотный прогон, затем полный запуск», и до последней ступени доходит лишь победитель попарных сравнений. Важная рамка для восприятия: это исследовательский результат внутри бенчмарка, а не поставляемая система, хотя состав команды из ~33 авторов с именами уровня Jason Weston и Jakob Foerster указывает на высокое внимание к методу.

Почему это важно для индустрии

Для команд, строящих автономных исследователей и compute-ограниченные ML-пайплайны, главная цифра экономическая: обе версии RPM выходят на результат 24-часового базового агента примерно за 15 часов, тратя менее двух третей бюджета выполнения, то есть почти треть вычислений высвобождается без изменения весов модели. Отдельный методологический сигнал: agentic версия стабильно сильнее inference-only (0.729 против 0.711 при базовых 0.684), значит короткая дешёвая эмпирика с реальными метриками добавляет измеримый прирост поверх чистого рассуждения над планами и кодом. Если прирост воспроизводится вне AIRS-Bench, ступень отбора рискует стать стандартной функцией агентных фреймворков и MLOps-инструментов, а конкуренция сместится к качеству распределения фиксированного бюджета запусков и доменным preference-данным.

Почему это важно для пользователей

Если у вас собственный агентный пайплайн, где каждая полноценная проверка стоит часы GPU, приём доступен уже сегодня: статья и код открыты под CC BY 4.0, а порог входа низкий, поскольку ничего обучать не нужно. Минимальный путь — встроить в собственный оркестратор ступень отбора: сначала рассуждение LLM над планами, кодом и прошлыми экспериментами (inference-only RPM), затем короткие пилотные прогоны на 5–30 минут с оценкой метрик (agentic RPM). Это не готовый продакшен-компонент, а паттерн, который собирается руками; заявленные цифры получены на AIRS-Bench, поэтому на своих задачах прирост и экономию стоит измерить самостоятельно.

Что пока неизвестно / ограничения

Все цифры получены на одном бенчмарке AIRS-Bench (20 задач: языковое моделирование, математика, биоинформатика, временные ряды) внутри одного каркаса AIRA-dojo, где из 15 генерируемых вариантов до полного запуска доходит только победитель попарных сравнений; перенос результата на другие домены и рабочие задачи пока не подтверждён. Статистическая значимость разницы 0.684–0.729 требует независимых проверок, а качество отбора упирается в способности базовой LLM к рассуждению и оценке. Наконец, это препринт, а не поставляемая система: немедленных рыночных сдвигов ждать не стоит.

Источники

Автор

Look at AI, редакция