Cohere Parse
Превращает сложные многостраничные документы и таблицы в чистый Markdown за копейки

Любая оцифровка верстки с таблицами и врезками обычно превращается в кашу из битого текста. Cohere Parse решает эту рутину напрямую: зрительно-языковая модель разбирает тяжелые мультимодальные файлы и выдает аккуратный Markdown с сохраненной структурой колонок и ячеек. Инструмент заточен под автоматическую обработку контрактов, счетов и многостраничных отчетов, готовя чистые данные для индексации, RAG-систем и автономных агентов.
Что умеет
- Распознает сложные таблицы, встроенные иллюстрации и смысловое оформление текста, сохраняя естественный порядок чтения.
- Стабильно читает документы на девяти основных мировых языках.
- Держит скорость в 4,5 страницы в секунду на базовой конфигурации и разгоняется до 2160 страниц в минуту на кластере из восьми карт H100.
- Встраивается в экосистему Cohere Search вместе с Embed и Rerank, поддерживая готовые коннекторы к Google Drive и SharePoint.
- Маршрутизирует документы через текстовый или визуальный пайплайн, работая в том числе с форматами .docx, .xlsx и .html.
Цены и доступ
Базовый вызов через API обходится в $1,50 за каждую тысячу страниц. Для масштабных задач доступно изолированное развертывание в Model Vault, снижающее затраты на страницу до 61% при полной загрузке мощностей. Модель также открыта в каталогах AWS SageMaker и Microsoft Foundry. Опробовать работу со своими файлами можно бесплатно в демо-пространстве на Hugging Face.
Инструмент пригодится разработчикам поисковых систем и тем, кто строит корпоративные базы знаний и устал вручную склеивать рассыпавшиеся ячейки после стандартных утилит оптического распознавания.


