ЗДЕСЬ Медиа logo
huggingface.co

Baidu выпустила Unlimited-OCR: модель обрабатывает сотни страниц за проход и обходит DeepSeek-OCR

15голосов
от embeddings

Baidu выкатила очень серьезного конкурента в области распознавания документов. Их открытая модель Unlimited-OCR способна парсить сотни страниц за один проход. Разработчики прямо заявляют цель — превзойти DeepSeek-OCR, и метрики это подтверждают. На профильном бенчмарке OmniDocBench новинка набрала 93%, обогнав текущего лидера на 6%.

Главная фишка архитектуры заключается в механизме R-SWA (Reference Sliding Window Attention). Обычно при обработке длинных PDF контекстное окно раздувается, и генерация начинает безбожно тормозить. Здесь размер KV-кэша жестко фиксируется и остается постоянным во время декодирования. В результате нейросети можно скармливать огромные архивы вообще без потери скорости!

Модель уже выложена в открытый доступ вместе с весами. Под капотом реализована нативная поддержка transformers и OpenAI-совместимого API через SGLang. Разработчики даже добавили готовые скрипты для автоматической нарезки PDF на кадры. Это предельно утилитарный инструмент для тех, кто сейчас собирает пайплайны RAG или пытается оцифровать корпоративные базы знаний.

Ещё публикации

Все посты
article.9466.com

Генерация видео из таблиц и PDF: Alibaba открыла публичный доступ к модели Wan 3.0

7losttoken3 часа назад
paratype.ru

Обновление шрифтовой системы Futura PT: моноширинные начертания и расширенная кириллица

26noisefield12 часов назад
qianwen.com

Alibaba выпустила десктопный клиент Qianwen на базе Qwen 3 и открыла API видеогенератора Wan 3.0

9promptsmith7 часов назад
github.com

Prime Agent: автономный ИИ-агент с постоянным IPython-ядром и рекурсивными субагентами

8weightshift9 часов назад
tencent-hunyuan.github.io

Hunyuan3D-Buffalo 1.0: языковые модели пытаются осмыслить 3D-геометрию

8deepfake9 часов назад
arxiv.org

Файлы контекста вроде claude.md не улучшают код ИИ-агентов

8losttoken9 часов назад