На arXiv опубликована препринт-статья «Toward a social psychology of AI: language-model agents reproduce human-like minimal-group bias» (arXiv:2609.00009, автор Messi H. J. Lee): в контролируемой пробе, перенесённой из социальной психологии, ИИ-агенты начинали фаворизировать «свою» группу по одной произвольной метке — без единого стереотипа в обучающих данных. В четырёх open-weight reasoning-моделях фаворитизм исчезал в группово-слепом контроле, а его картина зависела от численности групп и режима рассуждений.

Что произошло
29 июля 2026 года на arXiv появилась препринт-статья «Toward a social psychology of AI: language-model agents reproduce human-like minimal-group bias» (arXiv:2609.00009, категории physics.soc-ph и cs.CY) автора Messi H. J. Lee. Автор превратил классический эксперимент социальной психологии — парадигму минимальной группы — в контролируемую пробу для ИИ-агентов: агент из общества в 20 агентов распределяет 100 очков между 19 анонимными участниками, зная о каждом только произвольную метку группы. Пробу прошли четыре open-weight reasoning-модели: Qwen3-8B в режиме thinking, DeepSeek-R1-Distill-Llama-8B, DeepSeek-R1-Distill-Qwen-14B и Phi-4-reasoning 14B. Во всех четырёх моделях сама категоризация вызывала фаворитизм по отношению к своей группе, который исчезал в группово-слепом контроле. Смещение концентрировалось у решающих агентов из численного меньшинства: они отдавали своей группе больше, чем пропорционально её размеру, а при равных размерах групп асимметрия пропадала. Выключение reasoning в одной из моделей не убрало фаворитизм, а усилило его, но почти стёрло разницу между меньшинством и большинством.
Контекст
Парадигма минимальной группы — классический феномен социальной психологии: люди начинают фаворизировать «своих» по ярлыку, который ничего не сообщает о качествах участников. Перенос этой пробы на языковые модели позволяет формально отделить социальное смещение агентов от заученных в данных стереотипов: метка здесь бессмысленна, поэтому наблюдаемый эффект объясняется самой группировкой, а не содержанием обучения. Актуальность работы связана с зазором в существующих проверках: современные аудиты LLM либо ищут заученные стереотипы в ответах, либо используют модели как симуляторы людей, и ни один из этих подходов не измеряет социальное поведение агентов в группах. Публикация закрывает именно этот зазор воспроизводимым контролируемым протоколом, взятым из арсенала социальной психологии.
Почему это важно для индустрии
Для индустрии это вклад в eval, а не в продукт: готовых фич работа не даёт, зато даёт дешёвый и переносимый протокол измерения группового смещения агентов — класс риска, который существующие аудиты не покрывают. Для ред-тиминга мультиагентных систем — роёв агентов и симуляций обществ — из статьи следуют два настраиваемых рычага: состав и размеры групп, где работает асимметрия «меньшинство решает — смещение растёт», и переключатель reasoning, меняющий локализацию смещения, а не его наличие. В перспективе минимально-групповой протокол может стать стандартным модулем аудита мультиагентных систем, а состояние reasoning — обязательной осью сравнения конфигураций наряду с качеством решений, стоимостью и задержкой инференса. Пробу уже можно зашивать в eval-пайплайн командам, которые гоняют агентов группами.
Почему это важно для пользователей
В день публикации для читателей ничего не меняется — изменение процессное. Практический вывод касается тех, кто запускает агентов группами: в дебатах, симуляциях и мультиагентных пайплайнах агенты могут фаворизировать «свою» метку, даже когда она бессмысленна, поэтому распределение ролей, ресурсов или голосов между агентами стоит проверять на смещение. Включённый режим рассуждений меняет картину распределения, так что конфигурации с reasoning и без него полезно сравнивать отдельно. Разумный шаг — внести минимально-групповую пробу в релизный чек: общество из 20 агентов, распределение 100 очков, произвольные метки и группово-слепой контроль в качестве сравнения. Статья открыта бесплатно на arXiv в HTML и PDF, а все четыре протестированные модели — open-weight, поэтому эксперимент можно повторить на своём стеке самостоятельно.
Что пока неизвестно / ограничения
Материал — препринт единственного автора (подан 29 июля 2026), и в предоставленных данных нет сведений о прохождении рецензирования. Эффект показан на четырёх open-weight reasoning-моделях размером 8B–14B; перенос на закрытые, более крупные или иные по устройству модели, как и проявление в более длинных и многошаговых мультиагентных взаимодействиях, не продемонстрирован. Количественные оценки — effect sizes и статистическая значимость — в доступных материалах не приводятся, поэтому сила эффекта пока неясна. Независимая проверка другими командами только предстоит: публичная дискуссия минимальна, у треда на Hacker News один балл и ноль комментариев.
Источники
- Toward a social psychology of AI: language-model agents reproduce human-like minimal-group bias (arXiv:2609.00009)
- Полный текст статьи (HTML-версия arXiv, arXiv:2609.00009v1)
- Обсуждение на Hacker News
Автор
Look at AI, редакция
