🧮 UC Berkeley выпустила Vero — первый бенчмарк для формально верифицированного кода
Команда Dawn Song (Zhe Ye, Hantao Lou, Yuechun Sun и др.) собрала 43 мультимодульных проекта на Lean 4 — 743 API, 2705 спецификаций из реального кода на Python, Dafny, Verus, Coq. В режиме codeproof агент сам пишет реализации и машинно-проверяемые доказательства.
🌍 Оценка смещается от отдельных функций к целым репозиториям с машинной проверкой: GPT-5.5 (xhigh) в Codex полностью решил 27 из 43 проектов (87,3% спецификаций), Claude Opus 4.8 — 8 из 43. 10 проектов не взяла ни одна конфигурация — верифицированный синтез на уровне репозитория пока не по силам агентам.
👤 Открыто: GitHub sunblaze-ucb/vero, arXiv 2608.13522, публичный лидерборд. Видно, какие 10 репозиториев (от floating-point до KV-хранилища ironkv) не берут frontier-модели, — можно запустить свой агент.
Источник 1: https://vero.verina.io/ Источник 2: https://arxiv.org/abs/2608.13522
