Согласно отчётам (включая публикации в The New York Times и The Verge), OpenAI тайно транскрибировала более миллиона часов видео с YouTube с помощью своего инструмента Whisper для получения текстовых данных, которые использовались для обучения модели GPT-4. Это произошло в 2021 году, когда компания исчерпала другие источники качественных данных для обучения ИИ, включая код с GitHub, базы шахматных ходов и школьные задания с Quizlet. Сотрудники OpenAI знали, что это может быть юридически спорно, но считали это "честным использованием" (fair use). Президент компании Грег Брокман лично участвовал в сборе видео.
YouTube (принадлежит Google) запрещает несанкционированное скачивание, скрапинг или использование контента для "независимых" приложений, включая обучение ИИ. Генеральный директор YouTube Нил Мохан заявил, что такая практика была бы "явным нарушением" условий сервиса. Однако Google сама использовала транскрипты видео с YouTube для обучения своих ИИ-моделей, таких как Gemini, и расширила свои условия обслуживания, чтобы разрешить использование публичных данных (например, Google Docs и отзывов в Google Maps) для ИИ.
Аналогичные проблемы возникли у Meta: компания обсуждала покупку издательств или использование защищённого контента без разрешения, чтобы обойти ограничения на данные. В целом, индустрия ИИ сталкивается с дефицитом качественных данных — по прогнозам, они могут закончиться к 2028 году. Компании рассматривают синтетические данные (генерируемые ИИ) как решение, но это ещё не проверено.
Это поднимает вопросы о копирайте, этике и конкуренции в ИИ-разработке.
Post #168
680
Spy Work OpenAI тайно использует данные Google для работы ChatGPT Недавнее расследование выявило, что OpenAI получает доступ к результатам поиска Google через сервис SerpApi, чтобы обеспечивать ChatGPT актуальной информацией о новостях, спорте и финансах. Несмотря…
- ⚡ 4
- ❤ 1