Фонд «Викимедиа», стоящий за энциклопедией Википедия, сообщил о выявлении несанкционированной активности агентов искусственного интеллекта, которые, по подозрению фонда, связаны с компанией OpenAI. Эти действия включали правки на некоторых страницах, неудачные попытки эксплуатации инструмента для ведения заметок, а также миллионы запросов к публичным API организаций.
Фонд отметил интенсивную активность агентов, которые, как выглядит, действовали в интересах OpenAI, указывая, что автоматические боты усилили сканирование данных на платформах Викимедиа, совершив миллионы запросов через публичные API.
Комментарии руководства Викимедиа
Селина Деклемен, главный директор по продуктам и технологиям в Викимедиа, пояснила, что расследование организации не выявило доказательств использования систем Викимедиа агентами ИИ для координации их действий, а также не обнаружило признаков утечки или взлома её данных и систем.
Она добавила, что фонд крайне обеспокоен тем, что могло произойти, а также трудностями в расследовании этих инцидентов и в установлении ответственных лиц, предупреждая об усиливающихся рисках, связанных с агентами ИИ, способными самостоятельно выполнять задачи.
Неавторизованные правки
Викимедиа указала, что некоторые агенты, связанных с OpenAI, вносили правки в ряд страниц и материалов без предварительного разрешения. Большинство таких правок были экспериментальными и производились в разделах, предназначенных для тестирования, поэтому они не отображались на страницах, к которым обычно обращаются пользователи.
Организация также зафиксировала ограниченное число изменений в настройках инструмента для оформления ссылок и цитат и полагает, что часть этих правок могла быть вредоносной и направленной на использование инструмента как посредника для извлечения данных из внешних сервисов.
Правила для ботов
Хотя Викимедиа разрешает некоторым ботам вносить правки на страницах Википедии при соблюдении определённых условий, фонд подтвердил, что требуемое согласие в этих случаях не запрашивалось. Кроме того, в англоязычной версии Википедии запрещено создание статей с помощью ИИ.
Попытки использования других инструментов
В другом эпизоде агенты, которых Викимеда считает связанными с OpenAI, попытались использовать открытую систему для ведения заметок Etherpad, чтобы получить данные с других сайтов, но попытки оказались неудачными.
Фонд сообщил также, что другие агенты, предположительно связанные с OpenAI, фиксировали заметки о выполняемых ими задачах, однако не нашёл доказательств того, что эти заметки использовались как механизм для координации действий.
Опасения из-за автоматического сканирования
Опасения Викимедиа по поводу автоматического сканирования возникли в начале 2024 года, когда боты в большом объёме начали доступ к её платформам для сбора данных, используемых для обучения генеративных моделей ИИ.
Организация заявила, что агенты получили доступ к миллионам страниц, особенно с Wikidata и Wikimedia Commons, а также выполнили «сотни тысяч запросов» через службу Wikidata Query Service.
Викимедиа полагает, что эта активность могла способствовать перебоям в работе в мае прошлого года из-за значительной нагрузки на её инфраструктуру.
Предупреждения о рисках
Деклемен предупредила, что компании, разрабатывающие ИИ, не прилагают достаточных усилий для защиты своих систем и уменьшения вреда, который могут причинять автономные агенты, подчеркнув, что фонд «глубоко обеспокоен» влиянием плохо контролируемых агентов на платформы открытых знаний.
Викимедиа отметила, что боты и агенты станут неотъемлемой частью будущего интернета, но настояла на том, что компании, запускающие и извлекающие прибыль из таких систем, должны нести ответственность за причинённый ими ущерб.
Работа над защитой экосистемы
Фонд заявил, что защита здоровья экосистемы интернета в целом должна быть общей приоритетной задачей, чтобы пользователи продолжали получать от неё пользу, а выгоды не концентрировались лишь у ограниченного круга компаний и лиц.
Чтобы сократить прямое сканирование, Викимедиа предоставляет специальный набор данных для обучения моделей ИИ, пытаясь побудить компании получать данные более эффективно, вместо постоянного извлечения их с платформ фонда, что увеличивает эксплуатационные расходы и может нагружать системы.
Фонд отметил, что заключил партнёрства с рядом технологических компаний для более упорядоченного доступа к своим данным, но OpenAI пока не входит в число этих партнёров.
