PandaETL
No-code инструмент для автоматического извлечения данных из PDF, аудиозаписей, писем и веб-страниц
PandaETL — опенсорсный инструмент, который достаёт и структурирует информацию из разнородных файлов без единой строчки кода. Решение избавляет от рутинного вычитывания и копирования данных из входящих материалов — PDF-файлов, электронной переписки, веб-страниц или аудиозаписей. За понятным визуальным интерфейсом скрывается движок парсинга, доступный пользователям без инженерного бэкграунда.
Что умеет
- Вытягивать данные из нескольких источников: платформа поддерживает файлы PDF, email-сообщения, сайты и аудио.
- Управлять пайплайнами без кода: настройка проектов и шагов извлечения происходит через веб-интерфейс.
- Структурировать задачи: внутри можно заводить отдельные проекты и привязывать к ним персональные сценарии обработки данных.
- Работать локально: фронтенд и бэкенд на Python разворачиваются на собственной машине или сервере.
- В дорожной карте заявлены гибкая кастомизация рабочих цепочек, подключение сторонних сервисов и диалоговый чат с документами для ответов на вопросы.
Цены и доступ
Проект полностью бесплатен и распространяется под свободной лицензией MIT. Исходный код открыт на GitHub, для развёртывания потребуются Node.js, Python, Conda и менеджер зависимостей Poetry.
Инструмент пригодится продюсерам, редакторам и дизайн-командам, которым нужно быстро выжать фактуру и структурировать брифы, расшифровки интервью или клиентские архивы для продакшена.


