Компания EverMind открыла под лицензией Apache 2.0 систему Raven, позиционируемую как «харнесс харнессов»: она сама конструирует и эволюционирует агентные обвязки под конкретную модель и домен, а Host Agent декомпозирует задачу в граф и координирует специализированных агентов до одного итогового результата. Репозиторий на GitHub уже собрал около 5 тыс. звёзд и 1,7 тыс. коммитов, релиз 0.2.3 датирован 27 сентября 2026 года, а вместе с проектом опубликован технический отчёт на arXiv и кейс THRESHOLD, где Raven отработал 42 раунда автономного цикла примерно за 4 дня. Ключевые цифры бенчмарков пока принадлежат прогонам самой EverMind, поэтому системе предстоит независимая проверка.

image
image

Что произошло

Компания EverMind опубликовала проект Raven в репозитории EverMind-AI/Raven: открытая лицензия Apache 2.0, около 5 тыс. звёзд и 1,7 тыс. коммитов к моменту первого публичного следа, актуальный релиз 0.2.3 датирован 27 сентября 2026 года. Внутри — память EverOS, SkillForge с корпусом из 114 190 навыков в SkillCorpus, четыре встроенных агента (Raven-Research, Raven-Code, Raven-Design, Raven-Oncall) и пресеты для подключения 13 внешних CLI-агентов, включая Claude Code, Codex, OpenCode, GitHub Copilot, Qwen Code, Hermes Agent и OpenClaw. Центральный демонстрационный артефакт — кейс THRESHOLD: по брифу от человека Raven отработал 42 раунда цикла «планирование — разработка — проверка» примерно за 4 дня и самостоятельно собрал сайт, постер, презентацию PPTX и играбельный FPS на Godot 4 с ареной и босс-файтом; релизные артефакты от 25 сентября 2026 года лежат в репозитории и проверяются вручную. В таблицах репозитория и техническом отчёте заявлены 76,5% у Raven-Research на агрегате DeepResearch Mixed против 68,9% у DeepSeek-Harness и 67,2% у MiroFlow, Pass@1 0,8762 у Raven-Code с Opus-5 на DataAgentBench, лидерство Raven-Design на PresentBench и результаты на SWE-bench Verified и SWE-bench Pro.

Контекст

Обвязка (харнесс) — это слой вокруг языковой модели: планировщик, инструменты, навыки и память, которые превращают модель в работоспособного агента. Традиционно этот слой собирают вручную, и именно он, а не сама модель, часто ограничивает итоговое качество агента. Технический отчёт arXiv:2609.33439 от 27 сентября 2026 года закрепляет другой подход: проектирование харнесса переносится с ручной инженерии на автономную конструкцию и эволюцию. В Raven он реализован через четыре рассоединённых модуля агента (Memory, Planning, Capability, Action): компоненты Evolver и Curator диагностируют сбои, тестируют изменения против бенчмарков и принимают только верифицированные правки. В результате каждая пара «модель + харнесс» становится компонуемой единицей, которую Host Agent собирает в All-Domain Collaboration Network: цель декомпозируется в граф задач (DAG), под конкретные подзадачи подбираются специализированные агенты, зависимости координируются, а результаты интегрируются в один итоговый артефакт. Архитектурно такая сеть специализированных агентов оппонирует монолитным системам вроде DeepSeek-Harness и MiroFlow.

Почему это важно для индустрии

Для индустрии это попытка вывести ценность из слоя ручной разработки framework'ов в слой оркестрации готовых агентов: вместо строительства собственного планировщика и памяти команды подключают CLI-агенты, которыми уже пользуются, через готовые пресеты и получают оркестрацию как задачу конфигурации. Для стартапов и продуктовых команд это резко удешевляет вход в мульти-агентную разработку — проверять приходится конфигурацию, приёмку артефактов и границы эксперимента, а не framework с нуля. Открытые таблицы бенчмарков вместе с релизными артефактами 42-раундового автономного запуска дают отрасли измеримый ориентир того, где сегодня проходит граница long-horizon-автономии без человеческого цикла. Если эволюция харнесса через Evolver и Curator покажет воспроизводимую дельту на внешних бенчмарках и появятся независимые репликации, Raven может стать открытой базой для meta-оркестрации и сравнения харнессов поверх одинаковой модели, а продуктовая ценность на этом рынке сместится к дизайну брифа, набору evals и инструментам приёмки результата.

Почему это важно для пользователей

Цена проверки нулевая: Raven бесплатен и ставится одной командой curl -fsSL https://raven.evermind.ai/install.sh | bash на macOS, Linux или WSL2; альтернативный путь — git clone и docker compose -f docker/docker-compose.yml up, после чего WebUI открывается на localhost:18793. Реалистичный сценарий на сегодня — закрытый пилот на нечувствительных задачах: research-автоматизация, внутренние тулинги, автопрототип по брифу или пакет презентационных материалов, обязательно с ручной проверкой результата и готовностью к смене конфигураций между релизами. Тем, кто уже пользуется CLI-агентами, проще всего оценить Raven как host-агента поверх привычных инструментов, подключённых через пресеты, и на своих задачах проверить связку «харнесс + модель». Уровень автономии оценивается наглядно: приложенные релизные артефакты в репозитории проверяются глазами, без пересказа.

Что пока неизвестно / ограничения

Все ключевые бенчмарк-цифры (в том числе 76,5% у Raven-Research на DeepResearch Mixed и 0,8762 Pass@1 у Raven-Code на DataAgentBench) — это прогоны самой EverMind на выбранных ею бенчмарках; независимых репликаций пока нет, а методология прогонов раскрыта не полностью. Модуль саморазвития Curator помечен в репозитории как экспериментальный, сам проект находится в стадии pre-alpha, и интерфейсы с конфигурациями быстро меняются между релизами. Кейс THRESHOLD — единичный показательный пример, а не систематическое доказательство устойчивой автономии на длинных горизонтах; какая глубина эволюции харнессов воспроизводится на внешних задачах и не принадлежащих EverMind бенчмарках, пока неизвестно.

Источники

Автор

Look at AI, редакция