Платформа Vals представила Vals-Smith — инструмент для автоматического создания кастомных бенчмарков на основе реальных GitHub-репозиториев, как публичных, так и приватных.

Что произошло
Система анализирует историю Pull Requests (PR), извлекает задачи по исправлению ошибок и создает изолированную среду с набором скрытых тестов. Это позволяет тестировать возможности LLM и ИИ-агентов на специфике конкретного кода, а не на общих наборах данных.
Контекст
Традиционные бенчмарки часто являются статичными и универсальными, что не позволяет оценить, насколько хорошо модель понимает архитектурные зависимости и логику конкретного проекта. Vals-Smith переводит процесс оценки из режима общих тестов в режим специфического инженерного QA.
Почему это важно для индустрии
Для индустрии это означает переход от общих оценок к персонализированному бенчмаркингу. Компании могут точно измерять пригодность моделей для своих уникальных инженерных задач и автоматизировать процесс QA кода с помощью ИИ, интегрируя такие инструменты непосредственно в CI/CD пайплайны.
Почему это важно для пользователей
Разработчики и архитекторы могут проводить локальную валидацию таких моделей, как GPT-4 или Claude, на своих реальных задачах. Это позволяет проверить, насколько хорошо конкретная модель справляется с архитектурой именно вашего проекта, прежде чем внедрять её в рабочий процесс, тем самым снижая риски неэффективного использования ресурсов.
Что пока неизвестно / ограничения
Существует конфликт между технической полезностью и рисками безопасности: работа с приватными репозиториями может создавать серьезные риски для защиты интеллектуальной собственности (IP).
Источники
- Vals-Smith: Custom GitHub Repository Benchmarking
- Linux kernel model benchmarking (Vals-Smith)
- Next.js model benchmarking (Vals-Smith)
Автор
Look at AI, редакция
