Jina AI выпустила jina-ocr-v1 — открытую модель разбора документов на 3,4 млрд параметров, построенную на архитектуре DeepSeek-OCR. Собственный вклад компании — спекулятивное декодирование FastMTP и пост-обучение GRPO с покомпонентными проверяемыми наградами: это дало прибавку в 7,4 балла на olmOCR-Bench, первое место по пропускной способности среди 14 систем (2,57 страницы в секунду на одной A100) и почти двукратное ускорение декодера на недорогих GPU. Веса уже опубликованы на Hugging Face, но лицензия CC BY-NC 4.0 разрешает только некоммерческое использование.



Что произошло
Jina AI выпустила jina-ocr-v1 — модель разбора документов на английском и китайском с 3,4 млрд параметров, из которых примерно 570 млн активны в декодере. Модель принимает сканы, фотографии и PDF и возвращает Markdown, где таблицы закодированы в HTML, а формулы — в LaTeX. По сравнению с базовым DeepSeek-OCR она улучшила результат на olmOCR-Bench до 83,4 против 76,0 и показала 91,14 на OmniDocBench v1.6. На одном ускорителе A100 при 32 параллельных запросах модель обработала 2,57 страницы в секунду, выйдя на первое место по пропускной способности среди 14 сравнённых систем. Веса под именем jinaai/jina-ocr-v1 опубликованы на Hugging Face.
Контекст
Архитектура унаследована от DeepSeek-OCR и сама по себе не является вкладом Jina: визуальный энкодер DeepEncoder примерно на 380 млн параметров (SAM на 80 млн и CLIP-L на 300 млн) сжимает страницу 1024×1024 в 256 визуальных токенов, а MoE-декодер DeepSeek-3B превращает их в текст. Новизна релиза сосредоточена в двух элементах. Первый — FastMTP: один общий плотный draft-блок рекурсивно предсказывает K=3 токена вперёд, и каждая догадка проверяется без потери качества; на ускорителе NVIDIA L4 это даёт ускорение около 1,95x без CUDA-графов и 1,17x с ними. Второй — пост-обучение методом GRPO с плотными верифицируемыми наградами: итоговая награда раскладывается на компоненты вроде edit distance, метрики TEDS для таблиц, соответствия формул и юнит-тестов, так что модель обучается на автоматически проверяемых сигналах. Для полноты картины: на OmniDocBench v1.6 компактная PaddleOCR-VL-1.6 набирает 96,34, а на olmOCR-Bench chandra-ocr-2 показывает 85,8 и dots.mocr — 83,9, то есть jina-ocr-v1 не является абсолютным лидером по точности. Сами разработчики приводят эти проигрышные цифры, что говорит о корректной отчётности.
Почему это важно для индустрии
Главный отраслевой сигнал — экономика спекулятивного декодирования на OCR-задачах: один переиспользуемый плотный draft-блок почти ничего не стоит, но даёт практически двукратное ускорение декодера без потери качества. Для команд, массово переводящих архивные документы в Markdown, это ощутимо дешевле: рекордная пропускная способность на одной A100 означает меньше GPU-часов на страницу, и документный ingest для RAG и агентов превращается в дешёвый конвейерный этап, где скан, фото или PDF на входе дают готовый Markdown на выходе. Второй сигнал — декомпозиция награды оказалась важнее размера модели: 3,4-миллиардная модель с GRPO обошла olmOCR-2 с 8 млрд параметров (82,4) на olmOCR-Bench. В результате выбор OCR-модели превращается в задачу баланса скорости, качества, цены и лицензии, а приём с переиспользуемым draft-блоком, вероятно, начнут копировать в других моделях структурированного вывода, усилив конкуренцию за страницы в секунду на бюджетных GPU.
Почему это важно для пользователей
Воспользоваться можно двумя путями. Первый — zero-infra: документы прогоняются через r.jina.ai или Jina Reader с API-ключом и заголовком X-Respond-With: jina-ocr-v1, ничего устанавливать не нужно. Второй — self-hosted: веса jinaai/jina-ocr-v1 скачиваются с Hugging Face и запускаются на недорогих GPU класса L4 или consumer-сегмента через vLLM 0.21+, где включается ускорение FastMTP. Помимо перевода страниц в Markdown модель умеет подписывать изображения, отвечать на вопросы по документу и извлекать ключевые поля. Ключевая оговорка для практиков: лицензия CC BY-NC 4.0 запрещает коммерческое использование открытых весов, поэтому для коммерческого продукта подойдёт либо API-доступ через Jina, либо модель с другой лицензией.
Что пока неизвестно / ограничения
Модель обучена на английском и китайском; поддержка остальных языков из приведённых материалов не следует. Заявленные 2,57 страницы в секунду — метрика пропускной способности при батчинге, а не задержка одиночного запроса, и при оценке заявлений это различие важно. Открытые веса лицензированы под CC BY-NC 4.0, то есть только для некоммерческого использования. Прогнозы о копировании паттерна FastMTP другими командами — интерпретация, а не установленный факт; поведение модели на реальных архивах с нестандартной вёрсткой и сложными документами остаётся за пределами приведённых бенчмарков.
Источники
- jina-ocr-v1: Faster Document Parsing on Low-Budget GPUs (блогпост Jina AI)
- jinaai/jina-ocr-v1 — карточка модели и веса (Hugging Face)
- Jina-OCR-v1: Efficient Document Parsing with Speculative Decoding and Dense Verifiable Rewards (статья на arXiv)
Автор
Look at AI, редакция
