Домой Новости Индустрия и рынок Раскрыты внутренние документы Microsoft и OpenAI о проблемах обучения ИИ

Раскрыты внутренние документы Microsoft и OpenAI о проблемах обучения ИИ

В материалах судебного процесса между The New York Times и разработчиками ИИ обнаружены свидетельства того, что компании осознавали угрозу для издателей и масштаб незаконного использования данных.

3
0

В ходе продолжающегося три года судебного разбирательства между изданием The New York Times, компаниями OpenAI и Microsoft стали известны ранее скрытые факты об обучении нейросетей. В новых нередактируемых документах утверждается, что руководители корпораций в частных беседах признавали методы сбора данных «кражей» и оценивали влияние своих продуктов на медиаиндустрию как экзистенциальную угрозу.

Логотипы корпораций Microsoft и OpenAI на фоне кода

Признания руководителей о влиянии нейросетей на рынок СМИ

Материалы дела содержат внутренние высказывания представителей Microsoft и OpenAI, которые идут вразрез с их официальной позицией о «добросовестном использовании» (fair use) чужого контента. В частности, Брент Хехт, занимающий должность директора по прикладным наукам в Microsoft, в январе 2024 года описал ситуацию как «замкнутый цикл гибели» (doom loop). По его словам, подобная модель поведения вредит производительности самих ИИ-инструментов и всей сети в целом. В документе Microsoft прямо говорится: «Ситуация, при которой конечный продукт угрожает экономическим основам своих основных поставщиков, является крайне необычной, но именно её мы создали для нашего бизнеса LLM в отношении цепочки поставок контента».

Генеральный директор Microsoft Сатья Наделла в ходе дачи показаний подтвердил, что любой платный контент должен лицензироваться для нужд обучения ИИ. Он также отметил, что если бы знал об обходе платных доступов (paywalls) при сборе данных для обучения моделей OpenAI, то настоял бы на их переобучении без использования этих материалов.

Аналогичные опасения высказывали и в OpenAI. Руководитель направления ChatGPT Ник Терли признавал, что издатели сталкиваются с «экзистенциальной угрозой» из-за чат-ботов, которые по своей сути являются «субститутами» (заменителями) оригинального контента и становятся всё более эффективными в этом качестве. Президент OpenAI Грег Брокман также охарактеризовал свои модели как «отличные в новостях», что подтверждает их прямую конкуренцию с первоисточниками.

Масштабы копирования и методы сбора данных

Документы раскрывают технические детали того, как именно происходило формирование обучающих выборок. Согласно материалам, OpenAI и Microsoft использовали контент, собранный через индекс поисковой системы Bing, а также применяли методы обхода платных доступов. В одном из внутренних обсуждений исследователь OpenAI Ник Райдер сообщил Грегу Брокману о «взломе для обхода платного доступа к nytimes», на что тот ответил: «ах, хорошо».

Объемы копирования оказались беспрецедентными. Внутренние наборы данных OpenAI содержали более 91 692 копий работ, опубликованных The New York Times, Daily News и Center for Investigative Reporting. Исследования, базирующиеся на данных Common Crawl, включали свыше 2 миллионов документов только с домена nytimes.com. Внутренние инициативы, такие как «Project Taxi» и «Project Mango», позволили компаниям обмениваться массивами данных, содержащими не менее 160 903 уникальных статей различных издателей.

Более того, Брент Хехт в служебной записке от января 2023 года охарактеризовал практику сбора данных как «поразительную кражу беспрецедентных масштабов» и «крупнейшую кражу труда в истории человечества». В документах также описываются преднамеренные действия по удалению уведомлений об авторских правах из обучающих выборок, так как исследователи стремились исключить вероятность того, что нейросеть будет выдавать пользователям юридические пометки при генерации текста.

Противоречия в правовой защите ИИ-разработчиков

Судебный спор фокусируется на вопросе, подпадает ли использование материалов, защищенных авторским правом, под доктрину «добросовестного использования». Аргументы сторонников ИИ обычно строятся на том, что это обучение является «трансформативным». Однако данные Microsoft показывают, что использование Copilot привело к падению трафика на сайт The New York Times до 93% по сравнению с результатами традиционного поиска Bing. Это свидетельствует о том, что технологии скорее замещают оригинальный контент, чем способствуют его переосмыслению. Несмотря на публикацию этих сведений, ни OpenAI, ни Microsoft официально не ответили на запросы о комментариях.

Детализация процесса обхода ограничений и правовые нюансы

Материалы дела позволяют взглянуть на то, как именно выстраивалось техническое взаимодействие между корпорациями в рамках «цепочки поставок контента». Согласно поданным документам, процесс обмена данными был системным: OpenAI передавала полный набор данных для обучения GPT-3 компании Microsoft, чтобы та могла оценить возможности внедрения моделей в свои коммерческие продукты. В свою очередь, Microsoft предоставляла OpenAI данные через специализированные внутренние инициативы, такие как «Project Taxi» и «Project Mango». Именно в рамках последнего был сформирован массив, включающий не менее 160 903 уникальных материалов новостных издателей.

Особое внимание в иске уделено тому, как разработчики пытались скрыть следы своих действий. Помимо «взломов» для обхода paywall, сотрудники OpenAI активно использовали репозитории данных, такие как Common Crawl, для масштабного сбора контента. При этом исследователи осознанно удаляли информацию об авторстве из обучающих выборок. Причиной такого шага было желание избежать ситуаций, при которых нейросеть могла бы случайно воспроизвести защищенные копирайтом уведомления в своих ответах пользователям. Это свидетельствует о том, что специалисты компаний с самого начала понимали проблемный правовой характер используемых ими массивов данных.

Экономическая угроза и риски для занятости

Внутренние документы Microsoft содержат и другие крайне тревожные выводы, касающиеся будущего медиаиндустрии. Так, в одном из служебных отчетов прямо говорится о «реальном риске» того, что технологии генеративного ИИ способны «существенно нарушить занятость тех самых людей, чьи материалы использовались для обучения базовых моделей». Это противоречит одному из ключевых критериев «добросовестного использования» (fair use), который требует, чтобы заимствование не наносило ущерб рынку оригинального произведения.

Ситуация осложняется тем, что судьи в аналогичных спорах часто встают на сторону ИИ-компаний, признавая обучение «трансформативным». Тем не менее, нынешнее судебное разбирательство может создать прецедент, который заставит пересмотреть данные принципы. Важно отметить, что ранее в этом месяце администрация Дональда Трампа представила краткий отзыв в защиту OpenAI, поддержав идею об использовании контента без лицензирования. Однако опубликованные признания топ-менеджеров, включая прямые цитаты о замене информационных площадок результатами выдачи чат-ботов, ставят под сомнение легитимность подобных аргументов в глазах правосудия.

Стоит подчеркнуть: несмотря на то, что большинство этих данных стало известно благодаря судебному брифу The New York Times, сами первичные приложения (доказательная база) к иску остаются закрытыми для общественности. Представленные цитаты, по заявлению представителей издания, отражают лишь часть внутренней полемики, происходившей внутри корпораций в период активного масштабирования их ИИ-продуктов.

Источник: https://techcrunch.com