Опубликован watermarks-remover — инструмент с открытым исходным кодом для удаления скрытых маркеров происхождения контента, которые внедряют генеративные нейросети. Утилита очищает тексты от невидимых символов Unicode, специфических пробелов и двунаправленного форматирования, а также нейтрализует статистические водяные знаки, характерные для моделей Claude, Gemini (включая SynthID) и OpenAI. Нейтрализация текстовых маркеров происходит за счет переписывания контента с использованием опциональных хуков и локальных моделей.
Помимо работы с сырым текстом, система поддерживает очистку метаданных из файлов форматов PNG, JPEG, SVG, PDF, DOCX, HTML и Markdown. На этом уровне алгоритм вырезает C2PA-манифесты, EXIF, XMP и внутренние свойства документов. Для глубокой очистки PDF-файлов и полной перестройки их структуры инструмент автоматически задействует системную утилиту qpdf, что минимизирует риск восстановления удаленных трекинговых данных.
Архитектурно проект реализован как HTTP-сервис на базе стандартной библиотеки Python 3.10+, не требующий сторонних зависимостей. Это позволяет интегрировать его как локальный навык для AI-агентов или запускать в изолированных контейнерах Docker. Взаимодействие происходит через REST API или набор консольных скриптов, таких как clean_file.py и rewrite_text.py. При этом сервис автоматически определяет тип контента по сигнатурам файлов, предотвращая повреждение бинарных контейнеров при попытке текстовой обработки.
Поделиться:
Тяжеловесная айдентика и плотная типографика: дизайн фестиваля уличной фотографии МОССФ
Qwen 3.8 от Alibaba: анализ новых моделей на 27B и 2.4T параметров