БизнесбесплатноDeepSeek

DeepSeek-OCR-2

Открытая модель для перевода сложных документов и сканов в чистый Markdown

Вместо слепого считывания пикселей DeepSeek-OCR-2 разбирает структуру документа и конвертирует сканы напрямую в форматированный Markdown. Архитектура построена на имитации человеческого взгляда через механизм Visual Causal Flow. Модель считывает страницу последовательно, сохраняя исходную иерархию элементов или вытаскивая сплошной массив символов.

Что умеет

  • Переводить страницы в Markdown с сохранением верстки по команде <|grounding|>Convert the document to markdown.
  • Извлекать сырой текст без разметки макета через отдельный промпт Free OCR.
  • Адаптироваться к разным разрешениям картинок: по умолчанию кадр делится на фрагменты 768×768 и один общий план 1024×1024 пикселя, формируя от 256 до 1120 визуальных токенов.
  • Обрабатывать многостраничные PDF-файлы параллельно через стек vLLM со скоростью на уровне оригинального DeepSeek-OCR.
  • Работать в режиме потокового вывода при распознавании одиночных изображений.
  • Запускаться локально через Transformers и vLLM с поддержкой ускорения Flash Attention 2 и формата bfloat16.

Цены и доступ

Репозиторий проекта открыт на GitHub, а веса модели доступны для загрузки на Hugging Face. Для локальной сборки авторы предлагают окружение на базе Python 3.12.9, CUDA 11.8, PyTorch 2.6.0 и библиотеки vLLM 0.8.5.

Решение пригодится командам разработки и студиям, которым нужно автоматизировать оцифровку каталогов, архивов и презентаций без ручной переверстки таблиц и списков. Отличный способ очистить контент от графической шелухи за пару секунд в терминале.

Сайт DeepSeek-OCR-2
Бизнеспо запросу

Salesforce Koa

Рассуждающая CRM-модель для автоматизации сложных многошаговых процессов внутри Agentforce

Бизнесесть бесплатный тариф

Cohere Parse

Превращает сложные многостраничные документы и таблицы в чистый Markdown за копейки

Бизнесесть бесплатный тариф

Grok Voice Think Fast 2.0

Речевая модель с параллельным рассуждением и откликом за доли секунды