Стартап Synthetic Sciences из зимнего набора Y Combinator W26 27 сентября 2026 года вывел открытый научный агент OpenScience из беты и выставил его на Product Hunt. Обновление принесло переработанный рабочий стол, сервис моделей Ace и режим Autoresearch, в котором агент сам ведет серию экспериментов и поднимает заданную метрику, фиксируя ход работы в файлах study.md, ideas.md, results.tsv и lessons.md. По опубликованным трассам, на Terminal-Bench Science связка GPT-6 Astra и GPT-6 Sol решила 53 из 70 задач (75,7%) против 68,1% у Codex с той же ведущей моделью. Ядро бесплатное и открытое под Apache 2.0, работает с собственными ключами и локальными моделями, а монетизация перенесена в оплату моделей через сервис Ace.


Что произошло
Synthetic Sciences 27 сентября 2026 года перевела OpenScience из беты в публичный релиз и синхронно запустила его страницу на Product Hunt. Пользователям показали переработанный рабочий стол и платный сервис моделей Ace с более чем 30 моделями, в списке которых числятся GPT-6 Astra и Claude Opus 5.5. Центральная новинка — режим Autoresearch: агент начинает с базового запуска, затем перебирает идеи в порядке ожидаемой пользы и по каждому шагу решает, сохранить результат или откатить его. После 4 запусков без прогресса агент берет идеи другого типа, а каждые 6 запусков пересматривает подход. Вместе с релизом опубликованы бенчмарки: на Terminal-Bench Science (70 задач, 8 часов, одна попытка на задачу) OpenScience с GPT-6 Astra в роли ведущего и GPT-6 Sol в роли исполнителей закрыл 53 из 70 задач (75,7%) против 68,1% у Codex с той же ведущей моделью, а на 50 задачах BiomniBench-DA показал 82,2 против 81,04 у сравниваемой конфигурации. Трассы всех этих запусков выложены в отдельный репозиторий benchmarks-openscience.
Контекст
Ключевая деталь сравнения на Terminal-Bench Science в том, что обе конфигурации работают с одной и той же ведущей моделью GPT-6 Astra, поэтому отрыв корректно трактовать как выигрыш харнесса и оркестрации, а не как скачок способностей модели: это сравнение скаффолдов, а не моделей. Autoresearch по механике — управляемый hill-climbing по целевой метрике с бюджетом: подход наследует практики AutoML и подбора гиперпараметров, но вместо сетки параметров агент перебирает исследовательские идеи в порядке ожидаемой пользы, с эвристиками стагнации и остановкой по лимиту запусков или часов. Проект сознательно противопоставляет себя закрытым научным агентам: лицензия Apache 2.0, собственные ключи BYOK, локальные модели, исполнители на SSH/Slurm/PBS/Modal и файловые журналы решений. Бизнес-конструкция соответственная: ядро бесплатно и открыто, а оплата привязана к потреблению моделей через сервис Ace, что делает вход в автономные эксперименты почти бесплатным.
Почему это важно для индустрии
Гонка агентных продуктов смещается из написания кода в науку, и первый заметный эффект — методологический: публикация трассы каждого бенчмарк-запуска переводит «проверяемость» из лозунга в артефакт, который можно скачать и перепроверить пошагово, задавая планку отчетности, при которой цифру нельзя цитировать без прилагаемого артефакта. Бесплатный открытый инструмент со своими ключами давит на платных конкурентов и опускает порог входа в автономные эксперименты до установки npm-пакета, а инженерная зрелость каркаса — исполнители через SSH/Slurm/PBS/Modal, трекер метрик с шимом wandb — позволяет ставить его в существующую инфраструктуру, а не только показывать демо. Одновременно для самой Synthetic Sciences ключевой вопрос месяца — конвертация установок в оплату моделей через Ace: при почти бесплатном входе юнит-экономика решает всё. Если независимые группы подтвердят результаты по трассам, OpenScience может стать стандартным открытым бейзлайном научных агентов, а приемы Autoresearch — стоп-условия по бюджету, решения «сохранить/откатить», эвристики смены типа идей — начнут воспроизводить конкурирующие открытые и коммерческие продукты.
Почему это важно для пользователей
Инструмент уже можно поставить бесплатно: через npm install -g @synsci/openscience или как настольное приложение для macOS, Windows и Linux по ссылке openscience.sh/download. Дальше подключаются собственные ключи Anthropic, OpenAI или Google либо локальная модель, и можно запустить первый автономный эксперимент формулировкой вида «минимизируй val_loss, стоп через 20 запусков или 8 часов» с панелью метрик и привычным трекингом через шим wandb. Стоимость пилота сводится к вашим API-расходам; опциональный сервис Ace расширяет выбор до 30 с лишним моделей, но цены на него не раскрыты. Журналы Autoresearch остаются обычными файлами в вашем проекте, поэтому сессию можно продолжить, откатить или разобрать вручную. Заявленные результаты бенчмарков не нужно принимать на слово: трассы запусков лежат в репозитории benchmarks-openscience и позволяют пройти по каждому шагу самостоятельно, а разумный первый прогон — ограниченная задача на некритичных данных с явным потолком бюджета.
Что пока неизвестно / ограничения
Все ключевые цифры — самоотчёт проекта: набор задач, методологию и интерпретацию задаёт сам вендор, и хотя трассы позволяют перепроверять запуски пошагово, независимого подтверждения пока нет. Статистическая база слабая: 82,2 против 81,04 на 50 задачах BiomniBench-DA — разница в ползадачи, а 75,7% против 68,1% на Terminal-Bench Science — примерно 5 задач из 70 при одной попытке на задачу; без повторных прогонов и доверительных интервалов такие отрывы нельзя считать устоявшимися. Цены сервиса Ace не раскрыты, как и данные о конверсии установок в платящих клиентов Ace. Ключевой тест ближайшего периода — сравнение Codex и Claude Code с теми же моделями и равным бюджетом, а также воспроизведение трасс независимыми группами. В длительной перспективе открытым остается и вопрос, станут ли автономные циклы инструментом настоящих научных открытий: это зависит в том числе от риска подгонки целевой метрики самим агентом.
Источники
- GitHub — Synthetic Sciences OpenScience: The open-source AI workbench for scientific research (README с бенчмарками)
- GitHub — benchmarks-openscience: трассы всех бенчмарк-запусков OpenScience, сентябрь 2026
- RuntimeWire — Synthetic Sciences takes OpenScience out of beta with 30-plus models
Автор
Look at AI, редакция
