Компания Datalab открыла исходный код Lift — 9B-модели для извлечения структурированных данных из документов. Система принимает на вход PDF-файлы или изображения вместе с JSON-схемой и возвращает объект, при этом механизм schema-constrained декодирования гарантирует строгое соответствие заданному формату. Модель способна обрабатывать многостраничные документы за один проход, корректно извлекая значения, перенесенные между страницами.
На внутреннем бенчмарке разработчиков точность извлечения отдельных полей у Lift составила 90.2%, что сопоставимо с показателями коммерческой Gemini Flash 3.5 (91.3%) и превосходит специализированные открытые решения вроде NuExtract3 (81.5%) или Qwen3.5-9B (76.3%). При этом медианное время обработки одного документа составляет 9.5 секунды. Оценка проводилась с учетом сложных сценариев, включающих пересекающиеся данные, мультисурсную агрегацию и поля, которые намеренно должны оставаться пустыми.
Инструментарий проекта включает интерфейс командной строки для пакетной обработки директорий и локальное приложение Schema Studio для визуальной отладки структур. Установка базовой версии выполняется командой pip install lift-pdf, после чего поддерживаются два режима инференса: локальный через библиотеку HuggingFace и клиент-серверный с использованием vLLM.
Поделиться:
Машинная креативность или геометрия: как нейросети рисуют по координатам
Свежий шоурил студии MOOOV: визуальные эффекты и генеративные технологии в кино