🛠 AA-AgentPerf-Local: тест агентов на локальном железе

Artificial Analysis выпустила открытый бенчмарк скорости агентного инференса на ноутбуках и рабочих станциях: 8 реальных траекторий, 168 ходов модели, контекст до ~56 тыс. токенов. Работает с любым OpenAI-совместимым сервером, код опубликован.

🌍 Первый публичный замер таких нагрузок: RTX 5090 быстрее всех более чем в 3,5 раза (1792 ГБ/с), DGX Spark обошла Ryzen AI Halo в 1,4–1,7 раза при цене $4000. У MoE скорость предсказывает число активных параметров, а не общий размер.

👤 Прогоните свою связку «железо + llama.cpp/vLLM + модель» и сравните с лидербордом. Лучшие конфиги — со спекулятивным декодированием: +30–120%. Mac M5 Pro ($3700) близок к Ryzen AI Halo. Независимой проверки пока нет.

Источник 1: https://artificialanalysis.ai/articles/aa-agentperf-local Источник 2: https://github.com/ArtificialAnalysis/aa-agentperf-local