Сейчас загружается

Реальные доказательства: модели OpenAI умеют больше, чем просто учиться

Статья разбирает исследование, в котором проверялась способность моделей GPT-3.5 и GPT-4 запоминать фрагменты текстов через использование редких, «внезапных» слов. Результаты ставят под вопрос этичность использования защищённого авторским правом контента и вызывают обсуждение необходимости прозрачности в обучении AI.

Новое исследование и текущие споры вокруг использования защищенного авторским правом контента в обучении моделей искусственного интеллекта (ИИ) от компании OpenAI выявляют несколько ключевых моментов, которые стоит рассмотреть.

Исследование и Запоминание Контента

Новое исследование, проведенное учеными из Вашингтонского университета, Копенгагенского университета и Стэнфорда, показало, что модели OpenAI, такие как GPT-4 и GPT-3.5, «запоминают» фрагменты защищенного авторским правом контента. Исследователи использовали метод удаления слов из фрагментов художественных книг и статей New York Times и затем заставляли модели угадывать эти слова. Результаты показали, что модели успешно угадывали слова, указывая на то, что они запомнили эти фрагменты во время обучения[1].

Юридические Споры и Добросовестное Использование

OpenAI находится под давлением судебных исков от авторов, программистов и других правообладателей, которые обвиняют компанию в использовании их работ без разрешения. OpenAI утверждает, что обучение ИИ на этих данных является добросовестным использованием, но истцы спорят, что в законе США об авторском праве нет исключения для обучающих данных. Суды уже вынесли решения в пользу правообладателей, что создает прецеденты, которые могут повлиять на будущие дела[2][5].

Политическое Лоббирование

OpenAI активно лоббирует администрацию США для изменения правил авторского права, чтобы разрешить использование защищенных материалов для обучения ИИ. Компания утверждает, что без такого разрешения американские компании окажутся в невыгодном положении по сравнению с китайскими разработчиками, которые имеют более свободный доступ к данным. OpenAI призывает к федеральному закону, который бы заменил разрозненные законы штатов и обеспечил партнёрство между государством и технологическими компаниями[2][5].

Неисполнение Обещаний по Защите Авторских Прав

OpenAI не выполнила обещание выпустить инструмент Media Manager, который должен был помочь идентифицировать и контролировать использование защищенных авторским правом текстов, изображений, аудио и видео. Этот инструмент был анонсирован в мае 2024 года, но его разработка не была приоритетной, и с конца 2024 года никакой новой информации о проекте не поступало[3].

Возможные Решения и Перспективы

Эксперты предлагают различные решения, включая создание системы для сбора авторских отчислений для сайтов, которые предоставляют доступ для ИИ. Это могло бы включать специальное API для серфинга сайта и авторизацию у оператора сборщика отчислений. Однако, многие сомневаются, что такие инструменты смогут полностью решить проблемы, связанные с авторским правом, особенно учитывая сложность идентификации контента в больших масштабах[3][4].

Рерайт Статьи

Автор: Константин Финк

Недавнее исследование показало, что модели искусственного интеллекта от OpenAI, такие как GPT-4 и GPT-3.5, способны «запоминать» фрагменты защищенного авторским правом контента. Это открытие вызвало значительную обеспокоенность среди правообладателей и поставило под вопрос легальность использования таких моделей.

Исследователи из Вашингтонского университета, Копенгагенского университета и Стэнфорда провели эксперимент, в котором удаляли слова из фрагментов художественных книг и статей New York Times, а затем заставляли модели угадывать эти слова. Результаты показали, что модели успешно угадывали слова, что указывает на то, что они запомнили эти фрагменты во время обучения.

Этот факт стал очередным поводом для судебных исков против OpenAI. Авторы, программисты и другие правообладатели обвиняют компанию в использовании их работ без разрешения. OpenAI утверждает, что обучение ИИ на этих данных является добросовестным использованием, но истцы спорят, что в законе США об авторском праве нет исключения для обучающих данных.

Суды уже вынесли решения в пользу правообладателей, что создает прецеденты, которые могут повлиять на будущие дела. Например, в деле Thomson Reuters суд постановил, что обучение ИИ на материалах Thomson Reuters не является добросовестным использованием, поскольку выходные данные моделей потенциально заменяют оригинальный продукт.

В ответ на эти挑ения OpenAI активно лоббирует администрацию США для изменения правил авторского права. Компания утверждает, что без разрешения на использование защищенных материалов американские компании окажутся в невыгодном положении по сравнению с китайскими разработчиками. OpenAI призывает к федеральному закону, который бы заменил разрозненные законы штатов и обеспечил партнёрство между государством и технологическими компаниями.

Кроме того, OpenAI не выполнила обещание выпустить инструмент Media Manager, который должен был помочь идентифицировать и контролировать использование защищенных авторским правом текстов, изображений, аудио и видео. Этот инструмент был анонсирован в мае 2024 года, но его разработка не была приоритетной.

Эксперты предлагают различные решения, включая создание системы для сбора авторских отчислений для сайтов, которые предоставляют доступ для ИИ. Это могло бы включать специальное API для серфинга сайта и авторизацию у оператора сборщика отчислений. Однако, многие сомневаются, что такие инструменты смогут полностью решить проблемы, связанные с авторским правом, особенно учитывая сложность идентификации контента в больших масштабах.

В заключение, споры вокруг использования защищенного авторским правом контента в обучении ИИ моделей продолжают набирать обороты. Пока что нет четкого решения, которое бы удовлетворило все стороны, и будущее этого вопроса остается неопределенным.

Share this content:

Отправить комментарий