Artificial Analysis выпустила AA-AgentPerf-Local — открытый бенчмарк скорости инференса агентных ИИ-моделей на локальном железе: ноутбуках и рабочих станциях. Это первый публичный замер именно агентных нагрузок на локальных машинах: вместо синтетического потока токенов тест воспроизводит записанные реальные траектории агентов. Код, данные и готовые конфигурации обслуживания опубликованы в открытом репозитории, поэтому свою связку железа, сервера и модели уже можно сравнить с публичным лидербордом.

image
image
image

Что произошло

Бенчмарк воспроизводит восемь записанных реальных агентных траекторий суммарно на 168 ходов модели, причём контекст в ходе сессии растёт примерно до 56 тысяч токенов на запрос. Генерация детерминирована: каждый ход выдаёт ровно записанное число токенов, а выполнение инструментов по умолчанию пропускается, чтобы изолировать именно скорость инференса. Тест работает с любым сервером, совместимым с OpenAI API, включая llama.cpp и vLLM. Полностью открыты код, данные и 14 конфигураций обслуживания, все со спекулятивным декодированием: они опубликованы в репозитории ArtificialAnalysis/aa-agentperf-local. Первый замер охватил четыре платформы: CUDA, ROCm, Vulkan-совместимый Halo и Metal, и четыре модели в 4-битном квантовании: Qwen3.5-9B, плотную Qwen3.8-27B, MoE-модель Qwen3.6-35B-A3B с тремя миллиардами активных параметров и Ling 3.0 Flash со 124 миллиардами параметров, из которых активны пять миллиардов.

Контекст

До сих пор выбор локального стека для агентов опирался на замеры абстрактных токенов в секунду, слабо связанные с реальной работой агента. Агентная сессия устроена иначе: контекст постоянно растёт, и за одну сессию на вход модели подаётся около 196 тысяч токенов против примерно 31 тысячи сгенерированных, поэтому решающим этапом становится префилл, обработка новых входных токенов, а не декодирование. Детерминированная генерация в такой методологии принципиальна: разброс результатов между системами относится на счёт железа и serving-стека, а не на случайность сэмплинга, а тот же тест можно включить в непрерывную интеграцию как регрессию производительности и отслеживать деградацию скорости после обновлений.

Почему это важно для индустрии

Для AI-индустрии появились первые публичные точки отсчёта по агентным нагрузкам на локальном железе, и они показали нетривиальные механизмы. Число активных параметров MoE-модели предсказывает скорость лучше общего размера: Qwen3.6-35B-A3B с тремя миллиардами активных параметров быстрее плотной Qwen3.8-27B в 2,5–3,3 раза, но правило не абсолютное, поскольку Ling 3.0 Flash с пятью активными миллиардами всё равно медленнее плотной Qwen3.5-9B, а значит, важны также архитектура, реализация и квантование. Префилл занял 22–41% энд-ту-энд времени, то есть локальные агентные сессии упираются в пропускную способность памяти при обработке входа. Разрыв DGX Spark и Halo при одинаковых спецификациях объясняется зрелостью CUDA-стека, а измеренный фактор 1,4–1,7 при равной цене даёт вендорам ROCm конкретную измеримую цель. Стартапам стало дешевле проверять сценарий «агент на железе пользователя»: конкуренция смещается от вопроса «возможно ли локально» к вопросу «какая латентность за какой доллар», и закупку on-prem железа можно сверять с публичным лидербордом вместо маркетинговых цифр.

Почему это важно для пользователей

Бенчмарк открыт, и уже сегодня можно прогнать свою связку «железо плюс сервер плюс модель» и сравнить результат с опубликованным лидербордом, а готовые конфигурации из репозитория снижают порог входа. Из применимых выводов: спекулятивное декодирование есть во всех лучших конфигурациях и даёт +30–120% к скорости декодирования сверх потолка пропускной способности, поэтому его стоит включать сразу. На агентных сессиях заметны паузы на префилле: на Ryzen AI Halo агент может «задуматься» на 24 секунды, на MacBook на 39 секунд, против примерно 2 секунд на RTX 5090 с пропускной способностью памяти 1792 ГБ/с. Mac M5 Pro за $3700 идёт вплотную к Ryzen AI Halo на части моделей, при этом цены на DGX Spark и Halo на рынке заметно выше. Итог для читателя простой: вместо догадок о том, потянет ли локальный агент, можно посчитать латентностный бюджет конкретной связки и выбрать конфигурацию под свой сценарий.

Что пока неизвестно / ограничения

Пока бенчмарк описан единственным источником: статьёй Artificial Analysis и её же репозиторием, а связанная ветка Hacker News на момент подготовки материала имела ноль комментариев и один балл, так что независимых повторных прогонов и внешней критики методологии ещё не появилось. Охват первого замера тоже узок: ограниченный набор платформ, четыре модели и единственная точность квантования, поэтому выводы нельзя автоматически переносить на другие модели и форматы. Кроме того, тест изолирует скорость инференса и не выполняет инструменты, значит, опубликованные числа характеризуют модель, а не полную латентность реального агентного цикла с фактическими вызовами инструментов.

Источники

Автор

Look at AI, редакция