🤖 DeepMind впервые провела двойную слепую оценку frontier-модели
Gemini Flash Lite тестировали внешние организации — AI Safety Institute Сингапура, OpenMined, AVERI и MLCommons — по конфиденциальным бенчмаркам. Оценщики не видели весов модели, Google — промптов: вычисления шли в GPU-анклаве Google Cloud Confidential Space.
🌍 Индустрии это даёт независимый аудит frontier-моделей без раскрытия весов и бенчмарков. Признаки утечки тестовых данных находили примерно у половины из 31 проверенной модели.
👤 Схема не «trustless»: она предполагает, что облако и производитель чипов не сговариваются. Это шаг к независимым оценкам, а не полная гарантия.
Источник 1: https://deepmind.google/blog/piloting-the-worlds-first-double-blind-ai-evaluations/ Источник 2: https://storage.googleapis.com/deepmind-media/DeepMind.com/Blog/piloting-the-worlds-first-double-blind-ai-evaluations/double-blind-evaluations-technical-report.pdf
