Новость

OpenAI знала о пиратстве в датасетах и пыталась скрыть следы

Иллюстрация: редакция ЗДЕСЬ

Апрель 2019 года. Сэм Альтман и Дарио Амодеи показывают Биллу Гейтсу и техническому директору Microsoft Кевину Скотту раннюю версию GPT-3. Никаких формальных экивоков: руководители OpenAI прямо сообщают ключевому инвестору, что скормили модели колоссальный массив книг с теневого пиратского ресурса LibGen. Для технологических гигантов это не было досадной случайностью или ошибкой рядового инженера дата-отдела. Это был осознанный рабочий метод.

Правда всплыла в материалах Южного окружного суда Нью-Йорка. 17 сентября 2026 года в рамках процесса Alter v. OpenAI and Microsoft судьи раскрыли внутренние брифы и переписки команд. Инициатором разбирательства выступила писательская организация Authors Guild вместе с известными авторами. Вскрывшиеся документы показывают анатомию решений, которые годами принимались за закрытыми дверями: ясное понимание нелегальности источников, ирония над чужим трудом и планомерное заметание следов.

Репутация важнее права

Опасения у создателей системы вызывали вовсе не законы об авторском праве. Разработчиков волновала исключительно картинка в медиа. Тот же Дарио Амодеи в переписке называл использование пиратской платформы «довольно сомнительным», но на тренировку нейросетей это никак не повлияло. Исследователь OpenAI Сэм МакКэндлиш прямо писал коллегам, что его беспокоит лишь реакция публики. Больше всего команда боялась резонанса на форуме Hacker News: новость о том, что лаборатория берет защищенный копирайтом контент с сомнительного сайта, выглядела бы слишком неопрятно для будущего флагмана индустрии.

Когда внимание прессы начало расти, стартап перешел к маскировке. Летом 2022 года вице-президент по исследованиям Боб МакГрю дал старт секретной инициативе под кодовым названием Project Clear. Задача стояла конкретная: зачистить любые упоминания LibGen во всей корпоративной инфраструктуре. Следы пиратской базы методично вычищали из переписок в Slack, общих документов Google Docs и репозиториев на GitHub. МакГрю открыто мотивировал это возросшим интересом со стороны медиа — момент казался подходящим, чтобы убрать компрометирующие названия из систем и рабочих хранилищ.

Автодополнение чужих рукописей

Этические барьеры внутри лаборатории таяли по мере роста метрик. В 2022 году к команде присоединился исследователь Тарун Гогинени. Своей персональной миссией он открыто называл тренировку моделей на дописывание финальных глав саги Джорджа Мартина «Песнь льда и пламени». Гогинени иронизировал в переписках, что теперь спит спокойно: если писатель уйдет из жизни раньше времени, за него работу закончит GPT-5. Претензии авторов инженер парировал жестко — он считал происходящее «приемлемым экономическим потрясением», за которым последует неизбежная «смерть читателя» и бесконечный поток машинного шлака, созданного алгоритмами для других машин.

За два года до этих заявлений понимание социальных последствий в компании тоже было трезвым. В мае 2020 года директор по политике OpenAI Джек Кларк зафиксировал сценарий вытеснения креативного труда: «Наша работа в этой области сделает людей безработными... наступит момент, когда куча художников выразит беспокойство, и мы, скорее всего, проигнорируем их...» Кларк прямо указывал, что с развитием моделей авторы жанровой литературы на Amazon первыми ощутят жестокую конкуренцию со стороны генеративных текстов.

Писатели против алгоритмов

Авторы художественной прозы и нон-фикшна мириться с позицией компаний не стали. К иску Authors Guild присоединился внушительный список литераторов:

  • Джордж Р. Р. Мартин;
  • Джон Гришем;
  • Дэвид Балдаччи;
  • Джонатан Франзен;
  • Сильвия Дэй;
  • Майкл Коннелли;
  • Тейлор Бранч;
  • Кристофер Голден;
  • Эндрю Шон Грир;
  • Дэвид Генри Хванг;
  • Мэтью Клам;
  • Джоди Пиколт;
  • Стейси Шифф;
  • Джеймс Шапиро.

Интересы авторов в суде представляет адвокат Джастин А. Нельсон из юридической фирмы Susman Godfrey. Основные судебные слушания по существу назначены на начало 2027 года.

Для дизайн-директоров, копирайтеров и арт-директоров эти документы разрушают миф об аккуратной технологической революции. Популярные генеративные инструменты обучались на присвоенной чужой работе с последующим удалением улик из чатов. Юридические риски перестали быть абстракцией из профильных колонок. Если суд признает подобные датасеты прямым нарушением, вопрос о чистоте прав встанет перед каждым брендом и агентством, использующим сгенерированные ассеты. Нам придется внимательно проверять происхождение каждого блока текста и визуального слоя.

Чужой труд сначала забрали тайком, а потом попытались сделать вид, будто модель просто много читала по ночам.

Ещё новости

Все новости →