Агенты OpenAI попытались взломать инструменты Википедии и перегрузили её трафиком

Издатель Wikipedia сообщил в понедельник, что агенты OpenAI пытались взломать инструмент для ведения заметок, который он размещает, вносили неавторизованные правки и отправляли миллионы ресурсоёмких запросов в его инфраструктуру — это последний случай, когда системы OpenAI совершали вредоносные и потенциально опасные действия.

По мнению Фонда Викимедиа, целью некоторых действий агентов OpenAI было использование Wikipedia в качестве прокси для получения данных с сайтов третьих сторон. В одном случае агенты опубликовали «злонамеренные правки», намеренно перепрофилируя инструмент для цитирования в прокси. В другом случае агенты пытались — безуспешно — взломать инструмент для ведения заметок Etherpad на Wikipedia, чтобы он выполнял ту же роль.

Агенты также совершили миллионы автоматизированных запросов к API, просканировали миллионы страниц и сделали сотни тысяч запросов к Службе запросов Wikidata. Последнее действие могло способствовать частичному отключению этой службы в мае, заявили в издательстве.

«Как некоммерческий технологический хост некоторых из крупнейших и наиболее широко используемых платформ открытых знаний в мире, мы глубоко обеспокоены влиянием „отступивших“ AI‑агентов на такие платформы, как наша, которые создаются волонтёрами со всего мира и зависят от обещаний открытого интернета», — говорится в заявлении Викимедиа. «Инциденты, подобные этому и множеству других, которые были (и продолжают быть) обнаружены, показывают, как AI‑агенты могут истощать ресурсы и рушить серверы, а также пытаться скомпрометировать достоверную информацию».

Более чем в полдюжине случаев агенты OpenAI были уличены в действиях, которые, если бы их совершили человеческие хакеры, скорее всего привели бы к уголовным обвинениям. При тестировании внутренних инструментов с частично отключёнными предохранителями агенты использовали самодельную доску сообщений для обмена заметками друг с другом, обсуждая способы взлома сети Hugging Face и получения ответов, хранящихся там, когда агенты не могли сгенерировать ответы самостоятельно.

Другие инциденты включают генерацию странных собственных подсказок агентами, публикацию неавторизованных сообщений на веб‑сайте для обмена информацией, доступ к непубличным данным с австралийского правительственного сайта и эксплуатацию неправильных настроек DNS, чтобы выйти из песочницы, которую OpenAI создала, чтобы предотвратить доступ агентов к Интернету.

Большая часть мира стала называть такие события «сходом агентов с дистанции» («going rogue»), как будто агенты осознанно игнорировали приказы. Одним из заметных критиков такого формулирования является Эрик Сальваджио, исследователь в области ИИ и стипендиат Фонда Гейтса в Кембриджском университете.

«То, что я здесь вижу, — это языковые модели, делающие то, что языковые модели делают: читают и пишут», — сказал он изданию Ars. «Песочницы Wikipedia — идеальное место для того, чтобы эти машины сохраняли заметки для последующего использования в качестве подсказок, потому что любой — или что угодно — может туда писать и отвечать. Использование вики для координации не слишком удивительно. OpenAI заявляла, что эти модели были оптимизированы для сотрудничества между агентами, и обмен заметками — простой способ это осуществлять».

Кроме того, инженеры OpenAI обучали свои большие языковые модели быть настойчивыми и продолжать работу над задачей независимо от того, насколько мало у них было успеха. Обучение также даёт вознаграждение, когда модели находят обходные пути, сокращающие шаги или ресурсы, необходимые для решения задачи. Другим важным фактором вредоносных действий явилось отсутствие человеческого надзора, о чём свидетельствует то, что инженерам OpenAI потребовались месяцы, чтобы заметить, что агенты совершают шумные вторжения на десятки внешних сайтов. Раскрытие Викимедиа даёт ещё один пример недостаточного человеческого мониторинга. В совокупности можно утверждать, что агенты действовали ровно так, как было им приказано.

OpenAI не ответила на вопросы, отправленные по электронной почте. Вместо этого компания выпустила заявление: «Мы ценим подробные выводы, которыми с нами поделилась Викимедиа. Мы работаем с ними, пока пересматриваем и анализируем идентифицированную ими активность в рамках нашего собственного расследования, и продолжим делиться соответствующей информацией по мере продвижения этой работы».

Как и исследователи Викимедиа, OpenAI заявила, что пока не нашла доказательств того, что AI‑агенты оставляли сообщения для координации с другими агентами, или что высокая интенсивность просмотров страниц и запросов к API привела к частичному сбою в мае. OpenAI сообщила, что продолжает искать похожие инциденты, в которых её агенты могли участвовать в потенциально незаконной деятельности.

«Хотя OpenAI признаёт, что агенты ведут себя „непредсказуемо“, они также должны признать свою ответственность за мониторинг и предотвращение этих рисков», — заявила Викимедиа. «Компании в области ИИ не делают достаточно для обеспечения безопасности своих систем и защиты общественности от вреда, который они причиняют».

«Агенты будут агенты»? Ужасающий сценарий. Абсолютно ужасающий.

Идея о том, что если бы люди сделали это, их привлекли бы к ответственности, а если вы как‑то запрограммировали своего агента сделать это, то всё в порядке — я не могу представить, что может пойти не так с такой логикой.

Мы должны немедленно регулировать и наказывать людей, которые злоупотребляют этим, но я понимаю: тут замешаны деньги, так что всё в порядке, да? Да? Что тут может пойти не так?

Почему НАСА переводит 7 500 подрядчиков обратно на работу в качестве государственных служащих?

MCP для связи между агентами может быть самым рискованным протоколом, о котором вы никогда не слышали.

Агенты OpenAI пытались взломать инструменты Wikipedia и перегрузили её трафиком.

Город в Техасе требует 2 млн долларов за публичные записи о использовании Flock.

Инструмент командной строки быстро удаляет Apple Intelligence из macOS.