DeepSeek-OCR-2
Открытая модель для перевода сложных документов и сканов в чистый Markdown
Вместо слепого считывания пикселей DeepSeek-OCR-2 разбирает структуру документа и конвертирует сканы напрямую в форматированный Markdown. Архитектура построена на имитации человеческого взгляда через механизм Visual Causal Flow. Модель считывает страницу последовательно, сохраняя исходную иерархию элементов или вытаскивая сплошной массив символов.
Что умеет
- Переводить страницы в Markdown с сохранением верстки по команде
<|grounding|>Convert the document to markdown. - Извлекать сырой текст без разметки макета через отдельный промпт
Free OCR. - Адаптироваться к разным разрешениям картинок: по умолчанию кадр делится на фрагменты 768×768 и один общий план 1024×1024 пикселя, формируя от 256 до 1120 визуальных токенов.
- Обрабатывать многостраничные PDF-файлы параллельно через стек vLLM со скоростью на уровне оригинального DeepSeek-OCR.
- Работать в режиме потокового вывода при распознавании одиночных изображений.
- Запускаться локально через Transformers и vLLM с поддержкой ускорения Flash Attention 2 и формата bfloat16.
Цены и доступ
Репозиторий проекта открыт на GitHub, а веса модели доступны для загрузки на Hugging Face. Для локальной сборки авторы предлагают окружение на базе Python 3.12.9, CUDA 11.8, PyTorch 2.6.0 и библиотеки vLLM 0.8.5.
Решение пригодится командам разработки и студиям, которым нужно автоматизировать оцифровку каталогов, архивов и презентаций без ручной переверстки таблиц и списков. Отличный способ очистить контент от графической шелухи за пару секунд в терминале.


