Институт Аллена (Ai2) открыл под лицензией Apache 2.0 веса AstaBrief 8B — файнтюна Qwen3-8B, который по исследовательскому запросу и поданным фрагментам научных статей пишет отчёт со ссылками целиком за один проход. В сервисе Asta модель стала быстрым режимом Generate a report и готовит такой отчёт примерно в 3,5 раза быстрее, чем многошаговый Thinking-режим на Claude. Веса уже доступны на Hugging Face, поэтому связку «research-запрос, фрагменты статей, готовый отчёт со ссылками» можно поднять и на собственной инфраструктуре.


Что произошло
Фактически Ai2 выложила веса AstaBrief 8B в открытый доступ под Apache 2.0. Модель обучали на 47 тысячах SFT-примеров из реальных пользовательских запросов ScholarQA, где целевые отчёты генерировали Claude 3.5/3.7 Sonnet, o3, o4-mini и GPT-4.1, плюс около 6 тысяч DPO-пар, которые отбирали два судьи, GPT-4.1 и DeepSeek-R1: их оценки в 95% случаев совпали с человеческими. RL в этом рецепте сознательно не использовался. В сервисе Asta модель появилась как быстрый режим Generate a report и выдаёт отчёт в среднем за 51,1 секунды против 178,5 секунды у Thinking-режима на Claude. На наборе ScholarQA-CS2 из 200 вопросов по информатике AstaBrief набрала в среднем 87 баллов: recall ключевых элементов 90,2, точность ответа 89, точность ссылок 90,5, полнота ссылок 78,2. В парных сравнениях она обходит собственный многошаговый конвейер Asta ScholarQA на Claude в 72% случаев.
Контекст
Речь не о готовом исследовательском агенте, а о вырезанном из конвейера шаге. Основной режим Asta, ScholarQA, работает как многошаговый агент, до сих пор опираясь на дорогие фронт-модели; Ai2 сжала финальное письмо отчёта в компактную модель, показав, что для такой узкой структурированной задачи хватает дистилляции поведения сильных учителей без RL. По сути это перенос поведения закрытых фронт-моделей в открытые веса, а значит потолок качества AstaBrief ограничен тем, что умеют сами учителя. Подход меняет привычную форму research-агента: вместо цепочки шагов с несколькими проходами генерации — один проход по заранее собранным материалам вопроса.
Почему это важно для индустрии
Для индустрии дело прежде всего в экономике. Открытые веса под Apache 2.0 превращают генерацию обзоров со ссылками из дорогой сервисной функции коммерческих агентов в переиспользуемый артефакт, который институты могут держать на своей инфраструктуре — в том числе над чувствительными и непубликуемыми данными. Возникает новый тип компонента, «fast report over my own corpus»: retrieval-агностичный RAG-writer, встраиваемый в любой конвейер вместо дорогих вызовов фронт-моделей на финальном шаге генерации. Рецепт Ai2, скорее всего, повторят под другие домены, а научно-платформенные продукты, институциональные репозитории и корпоративные ассистенты начнут включать «отчёт со ссылками» как кнопку с низкой латентностью. Дифференциатор от этого смещается от генерации текста к данным, retrieval-этапу и проверке цитат: сервисы, чья ценность держится только в гладкости отчёта, оказываются под давлением.
Почему это важно для пользователей
Практическая часть доступна уже сейчас. Веса allenai/AstaBrief_8B лежат на Hugging Face: 8B-модель запускается локально через vLLM или transformers с рекомендованными параметрами temperature 0.7, top_p 0.95, max_tokens 4096, а готовый пример для отчётов по собственным PDF находится в репозитории ai2-scholarqa-lib в папке api/scholarqa/lite — MVP на своих документах реально собрать за вечер. Без установки модель можно попробовать в Fast-режиме на asta.allen.ai. Два обязательных условия: модель сама ничего не ищет, фрагменты статей нужно подать вместе с вопросом, и промпт должен следовать формату из sft_prompt.txt, иначе качество падает. Написанное всё равно нужно проверять: полнота цитирования — самая слабая сторона, гладкий отчёт может пропускать ключевые источники.
Что пока неизвестно / ограничения
Ключевые цифры — 72% парных побед над конвейером Asta ScholarQA на Claude и средний балл 87 на ScholarQA-CS2 — получены на бенчмарках и тест-наборе самой Ai2, независимой репликации до сих пор нет. Данные людей расходятся с метриками: в исследовании с тремя учёными и 14 вопросами участники в целом предпочли DR Tulu, хотя двое из трёх сочли ссылки AstaBrief точнее, так что замер на бенчмарке и человеческое восприятие пока говорят разное, а выборка слишком мала, чтобы это разрешить. Ещё неизвестно, как репликация ведёт себя вне информатики и на каких сочетаниях retrieval-систем и промптов сохраняется заявленный уровень качества.
Источники
- Open-sourcing AstaBrief, the fast report-generation model in Asta | Ai2
- allenai/AstaBrief_8B · Hugging Face (модель-карточка, лицензия Apache 2.0)
- ai2-scholarqa-lib — пример scholarqa/lite: отчёты по своим PDF
Автор
Look at AI, редакция
