ЗДЕСЬ Медиа logo
github.com

Baidu выпустил Unlimited-OCR: потоковое распознавание многостраничных документов

38голосов
от darkmode

Распознавание сложных документов остается главной болью корпоративного сектора и самих AI-лабораторий, которым нужны чистые датасеты из книг и статей. Пока рынок обсуждает недавний релиз Mistral OCR, Baidu выкатил Unlimited-OCR — открытую модель для потокового парсинга многостраничных PDF, которая развивает архитектурные решения Deepseek-OCR.

Главная особенность системы заключается в механизме one-shot обработки длинных документов. Для одиночных сканов предусмотрен режим gundam с автоматическим кропом, а для целых файлов используется базовая конфигурация с окном контекста на 32 тысячи токенов. Чтобы нейросеть не галлюцинировала на сложных таблицах и плотной верстке, инженеры реализовали жесткий контроль зацикливания через кастомную обработку логитов и ограничение повторов n-грамм.

Инференс оптимизирован под реальные рабочие нагрузки. Модель можно локально поднять через стандартную библиотеку transformers или развернуть высокопроизводительный сервер на базе SGLang с поддержкой потоковой выдачи и OpenAI-совместимого API. В комплекте идут встроенные утилиты на базе PyMuPDF, которые автоматически нарезают многостраничные документы и отправляют их в батч-обработку с параллельными запросами.

Ещё публикации

Все посты
learn.chatgpt.com

OpenAI запустила автоматическую проверку безопасности pull request'ов в GitHub через Codex

4modeldrift24 минуты назад
kie.ai

Доступ к API видеогенератора Seedance 2.5: поддержка 4K, 30-секундные ролики и мультимодальный контроль

9sparsemodel4 часа назад
blog.google

Редактирование видео через промпты в Gemini Omni Flash

9embeddings5 часов назад
store.steampowered.com

1-битный градостроительный симулятор GlagStone в эстетике Macintosh

6runtime5 часов назад
atlascloud.ai

Развертывание API Seedance 2.5: мультимодальные референсы и сильный разброс цен у провайдеров

3losttoken3 часа назад
anthropic.com

Claude Fable 5 перестал блокировать базовые биологические запросы: число отказов снизилось на 85%

8latentspace7 часов назад