🤖 Модель RPM учит ИИ-агентов выбирать лучшие идеи до дорогих запусков

Команда из ~33 исследователей, среди которых Jason Weston, Anirudh Goyal и Jakob Foerster, выложила на arXiv статью «AI Research Preference Models». Их RPM сравнивает несколько вариантов решения и выбирает самый перспективный до полного запуска, вместо того чтобы тратить часы GPU на каждый.

🌍 На 20 задачах AIRS-Bench внутри агента AIRA-dojo RPM подняла среднюю нормализованную оценку с 0.684 до 0.711 (inference-only) и 0.729 (agentic), а результат 24-часового прогона достигается примерно за 15 часов при бюджете меньше двух третей.

👤 Приём воспроизводим в своих пайплайнах: перед дорогой проверкой добавить дешёвый отбор — рассуждение над планами и кодом, затем короткие пилотные прогоны на 5–30 минут с оценкой метрик. Статья открыта на arXiv.

Источник 1: https://arxiv.org/abs/2608.13940

Источник 2: https://arxiv.org/html/2608.13940v2