Запущен Model Accent — бесплатный браузерный квиз «Which AI wrote this?»: посетителю показывают восемь коротких ответов на техническую тему и предлагают угадать, какой ассистент написал каждый — ChatGPT, Claude, Gemini или Grok. Проект анонимный и не публикует ни автора, ни методику подбора текстов, а всё обсуждение пока сводится к одной ветке Hacker News. Формально это пара минут развлечения, но по сути — народный слепой тест того, насколько одинаково теперь пишут флагманские модели.

Что произошло
На сайте https://modelaccent.com открылся бесплатный квиз «Which AI wrote this?». Читателю последовательно показывают восемь коротких ответов на техническую тему — например, о том, почему быстрый токен-скоринг не ускоряет агентские пайплайны, — и просят определить, кто из четырёх AI-ассистентов написал каждый фрагмент. Варианты на выбор — ChatGPT, Claude, Gemini и Grok, ответ выбирается клавишами от 1 до 4. Интерфейс сделан на Next.js: страниц с данными об авторе, лендинга с описанием проекта, FAQ и описания методики подбора текстов на сайте нет. Из публичного обсуждения есть только ветка на Hacker News, где на момент обзора квиз набрал четыре балла и один комментарий, а пользователи делятся собственными показателями угадывания.
Контекст
Квиз стоит особняком от детекторов вроде GPTZero: те пытаются программно угадать, написан ли текст моделью, тогда как Model Accent ничего не вычисляет и перекладывает оценку на человека. По сути это классическая механика слепого теста: участник не знает раскладки ответов по моделям и опирается только на ощущение от стиля. За этим стоит спорный тезис о стилистической конвергенции: общие техники выравнивания и типовые шаблоны промптов подталкивают флагманские модели к схожей манере письма, хотя это интерпретация, а не измеренный факт. Важен и базовый порог такой игры: при четырёх вариантах случайно угадывается четверть ответов, поэтому любые разговоры о «различимости почерков» имеют смысл только при больших выборках попыток.
Почему это важно для индустрии
Для индустрии квизы-угадайки вроде Model Accent работают как стихийные бенчмарки стилевой однородности флагманских ассистентов: если посетители стабильно не могут определить модель, значит стилевая разница между ответами провайдеров почти исчезла, и дифференциация смещается в цену, размер контекста и интеграции. Сам сайт для продакшена при этом бесполезен: у проекта нет API, pricing, методики и накопленной статистики, а ценна не платформа, а механика — слепой тест «угадай модель» это дешёвый и переиспользуемый продуктовый паттерн, который можно встраивать в собственные сравнения ассистентов. Если формат подхватят и появятся квизы с открытым протоколом и агрегацией точности по тысячам попыток, впервые получится краудсорсинговый измеритель стилевой различимости флагманов. До тех пор практический вывод один: не выбирать модель по «ощущению от стиля», а сверять кандидатов по цене, контексту, latency и надёжности, фиксируя выбор собственными evals.
Почему это важно для пользователей
Обычному читателю квиз даёт пару минут само-теста: восемь коротких текстов, четыре варианта и честный результат — станет ясно, действительно ли вы узнаёте «почерк» любимого ассистента или все четыре пишут как письменные клоны. Увидеть стилистическую схожесть ответов своими глазами полезнее любой обзорной статьи: после этого к уверенным заявлениям про «фирменный стиль» той или иной модели появляется здоровый скепсис. Если же угадывается всё подряд, это тоже диагноз — только вашей памяти на типовые формулировки, а не доказательство экспертизы.
Что пока неизвестно / ограничения
У проекта нет автора, методики и датасета: не описано, как отбирались тексты — какие версии моделей, какие промпты, какая дата генерации и сколько кандидатов отклонили, поэтому возможен отбор нарочно «усреднённых» ответов, искусственно повышающих неразличимость. Нет и верификации ground truth: читатель должен верить на слово, что каждый ответ действительно сгенерирован заявленной моделью, что делает эксперимент невоспроизводимым. Социальный сигнал пока микроскопический — одна ветка Hacker News с единственным комментарием (в сыром тексте треда три балла), и без агрегированной статистики невозможно понять, ниже ли реальные результаты пользователей порога случайного угадывания. Наконец, тезис о стилевой конвергенции флагманов остаётся интерпретацией, а не измеренным фактом.
Источники
Автор
Look at AI, редакция
