Дешёвая открытая модель Gemma 4 31B дала студентам прирост баллов GRE, статистически эквивалентный занятиям с живым экспертом-репетитором, — при цене в 918 раз ниже. Таков итог крупного рандомизированного исследования StudentBench, опубликованного 23 сентября 2026 года командой Handshake AI в препринте arXiv:2609.28470. Код, деанонимизированные данные и скрипт reproduce.py открыты, поэтому каждую цифру работы можно проверить самостоятельно.


Что произошло
Рандомизированное исследование охватило 2383 студента и 2469 сессий подготовки: 2139 прошли с ИИ-репетиторами, 140 с живым экспертом и 190 составили контрольную группу. Прирост баллов GRE у тех, кто учился с LLM-репетитором, оказался статистически неотличим от результатов занятий с человеком (p = .015), а в 5 из 7 доменов GRE лучший ИИ-репетитор обогнал живого наставника. Разница в деньгах ещё нагляднее: Gemma 4 31B стоила $0.0052 за один процентный пункт прироста против $4.81 у репетитора с почасовой ставкой $75. Авторы проследили и механизм: мгновенные ответы ИИ сопровождались большим числом сообщений от студента, большим количеством решённых практических задач и итоговым приростом, все корреляции значимы на уровне p < .002.
Контекст
До сих пор модели в образовании сравнивали в основном экзаменационными метриками, отвечая на вопрос «что модель знает», тогда как вопрос «чему она может научить» системно не проверялся. StudentBench смещает фокус именно на реальный учебный прирост и в таком масштабе впервые адресует «AI-эффект» — иллюзию обучения, при которой студенту кажется, что он освоил материал, хотя объективная проверка этого не подтверждает. Дизайн исследования необычно строгий для области, где обычно хватает маркетинговых кейсов: полноценный рандомизированный контроль вместо единичных кейсов и самоотчётов. Показательно, что учебная эффективность слабо привязана к классу модели: компактной Gemma 4 31B оказалось достаточно, то есть задача «научить» менее требовательна, чем «знать», и для edtech масса и цена модели важнее фронтира. Дополнительный вес работе придаёт репутация авторов: Curtis Northcutt и Jonas Mueller известны по benchmark'у label-errors об ошибках разметки в датасетах.
Почему это важно для индустрии
Для отрасли ценность не в формуле «ИИ = репетитор», а в подтверждённой данными петле ценности: мгновенная обратная связь дешёвой модели удерживает студента в практике, а практика даёт измеримый прирост при стоимости на три порядка ниже живого эксперта. Порог входа в персональное обучение падает почти до нуля: открытые веса Gemma 4 31B, публичный протокол StudentBench и воспроизводимый пайплайн reproduce.py позволяют небольшой команде за квартал собрать ИИ-репетитора и продавать подготовку к экзаменам на порядок дешевле человеческой. Конкуренция смещается с размера модели на латентность, UX-петлю вовлечения и качество практики, то есть выигрывает не лучший инженер, а лучшая продуктовая петля. Открытый датасет с 176 614 сообщениями, 45 463 практическими задачами и 2028 парными оценками от 51 эксперта-репетитора уже пригоден для fine-tuning и настройки evals, а сам StudentBench можно принять как внутренний eval с проверяемой гипотезой: снижает ли минимальное время ответа число решённых задач. Если независимые репликации подтвердят эквивалентность, вероятны волна tutoring-eval бенчмарков и включение learning gain в модельные лидерборды наравне с экзаменационными метриками.
Почему это важно для пользователей
Практический вывод для читателя прямой: если нужно закрыть пробел в математике или вербалистике перед экзаменом, ИИ-репетитор по скорости обратной связи уже конкурирует с человеком, а по цене вне конкуренции. Мгновенный ответ здесь не мелочь: именно скорость обратной связи, по данным авторов, тянет за собой объём практики, который и даёт прирост. Все цифры можно проверить самому: код под лицензией MIT лежит на GitHub, деанонимизированные данные студентов размещены на Hugging Face под CC BY 4.0, скрипт reproduce.py верифицирует каждый график и таблицу одной командой, а платформа StudentBench доступна на studentbench.org. Живой наставник не отменяется там, где нужны мотивация, менторство и разбор сложных кейсов, но для рутинной отработки практики альтернатива стала реальной и дешёвой.
Что пока неизвестно / ограничения
Механизм эффекта описан корреляциями, а не установленной причинностью: латентность ответов не рандомизировалась, а студенты, которые пишут больше сообщений, могут быть просто мотивированнее остальных. Все данные собраны только по GRE, поэтому перенос выводов на другие предметы, языки и профессиональные навыки остаётся допущением. Работа существует пока в статусе препринта и почти не обсуждалась сообществом: на Hacker News у неё 1 point и 0 комментариев. Независимых репликаций пока нет, и именно их исход определит, станет ли этот результат отраслевым ориентиром.
Источники
- Препринт StudentBench: AI and human tutoring yield equivalent GRE learning gains (arXiv:2609.28470)
- Handshake-AI-Research/studentbench — код, скрипт reproduce.py и данные исследования на GitHub (MIT)
- Датасет StudentBench на Hugging Face (CC BY 4.0)
- Официальный сайт платформы StudentBench
Автор
Look at AI, редакция
