🤖 Jina AI выпустила jina-ocr-v1 на базе DeepSeek-OCR
Модель разбора сканов и PDF на английском и китайском выдаёт Markdown с таблицами и формулами LaTeX: страница сжимается в 256 визуальных токенов. Вклад Jina — спекулятивное декодирование FastMTP и дообучение GRPO; на olmOCR-Bench — 83,4 против 76,0 у базовой модели.
🌍 Массовый перевод архивов в Markdown дешевеет: 2,57 страницы/с на одной A100 — первое место по скорости среди 14 систем, и 91,14 на OmniDocBench v1.6. На NVIDIA L4 FastMTP ускоряет декодирование почти вдвое (≈1,95x).
👤 Веса jinaai/jina-ocr-v1 — на Hugging Face под CC BY-NC 4.0, некоммерческое использование. FastMTP работает в vLLM; без установки можно прогонять URL через r.jina.ai с API-ключом Jina. Модель также подписывает изображения и отвечает на вопросы по документу.
Источник 1: https://jina.ai/news/jina-ocr-v1-faster-document-parsing-on-low-budget-gpus/ Источник 2: https://huggingface.co/jinaai/jina-ocr-v1
