🛠 Vals-Smith: оценивайте модели на своей кодовой базе

Платформа Vals представила Vals-Smith — инструмент для автоматического создания кастомных бенчмарков на основе реальных GitHub-репозиториев. Система анализирует историю PR, извлекает задачи по исправлению ошибок и создает изолированную среду с набором скрытых тестов для проверки LLM на специфике вашего кода.

🌍 Переход к персонализированной оценке позволяет компаниям точно измерять пригодность моделей для их уникальных инженерных задач и автоматизировать QA кода.

👤 Теперь можно проверить, насколько хорошо конкретная модель (например, GPT или Claude) справляется с архитектурой именно вашего проекта, прежде чем внедрять её.

Источник 1: https://www.vals.ai/vals-smith Источник 2: https://www.vals.ai/vals-smith/linux