🤖 Претрейн LLM без человеческих данных: proof-of-concept
На arXiv 24 сентября вышел препринт 2609.30063 «Self-Play Pretraining with Zero Data»: генератор и ученик стартуют со случайной инициализации — генератор предлагает программы, они исполняются на машине Тьюринга и порождают байты, ученик через cross-entropy их предсказывает, а генератор получает RL-награду за данные на границе возможностей ученика.
🌍 Объём полезных учебных данных здесь становится функцией compute: zero-shot-лосс предсказуемо падает на естественных датасетах с ростом self-play-вычислений, но пока это лишь малый proof-of-concept.
👤 Модель, ни разу не обучавшаяся на естественных данных, сама находила узнаваемые математические последовательности и обрела in-context learning — в отличие от Absolute Zero (2505.03335), где самопорождённые задачи лишь дообучали reasoning.
Источник 1: https://arxiv.org/abs/2609.30063 Источник 2: https://arxiv.org/pdf/2609.30063
