В ответ на новый закон Европейского союза платформы искусственного интеллекта внедряют новые схемы встраивания водяных знаков в создаваемый ими контент. Anthropic недавно сообщил, что будущие модели Claude будут использовать SynthID-Text — подход, разработанный Google и выпущенный как открытое программное обеспечение. Он использует секретный ключ, который тонко изменяет процесс выбора моделью следующего слова в предложении. Если наиболее вероятным следующим словом могло бы быть «cloudy» (облачно), ключ может изменить его на «overcast» (пасмурно). Любой, кто знает этот ключ, может определить, было ли содержимое сгенерировано платформой, использующей его.
Новое исследование показывает, что SynthID-Text может влиять не только на выбор слов, но и на инструменты, которые вызывает модель, и на вероятность соблюдения или игнорирования обученных ей правил безопасности. Угроза может усилиться в условиях вредоносного запроса, когда злоумышленник пытается заставить модель выполнить вредоносное действие, например раскрыть пароль или другую конфиденциальную информацию. Инструкции, которые обычно не выполнялись бы, в некоторых случаях будут исполнены после включения водяного знака. Это открытие подчеркивает необходимость того, чтобы разработчики тщательно тестировали поведение своих крупных языковых моделей и агентов при наличии встраиваемых водяных знаков.
Влияние водяного знака на поведение моделей
«По сравнению с теми же моделями без водяных знаков их поведение определённо изменится, особенно когда мы ставим их в противодействующие условия или заставляем эти модели вызывать инструменты, когда они работают в роли агента», — сказала Андреа Сипосова, исследователь по безопасности ИИ из Lasso Security, в интервью Ars. «Водяной знак сделан так, чтобы быть незаметным для читателя, но мы знаем, что когда мы что-то меняем в том, что генерирует модель, это приведёт к компромиссам — это где‑то проявится».
Встраивание водяного знака работает путём внедрения сигнала, который позволяет идентифицировать вывод как созданный ИИ, то есть указывающий на происхождение (provenance). SynthID берёт обычный процесс семплинга и добавляет в него генератор случайного семени, алгоритм выборки и функцию оценки. Вместо использования произвольного генератора случайных чисел при выборе следующего слова, в процедуре с водяным знаком применяется секретный ключ. Хотя выбор слова остаётся случайным, люди, обладающие знанием ключа, могут проверить последовательность слов, чтобы определить вероятность использования этого ключа.
Турнирное семплинг и его результаты
Ключевой особенностью SynthID является так называемый турнирный семплинг. Подобно спортивному турниру, SynthID оценивает большое количество кандидатов на следующий токен слова. Он использует секретный ключ для присвоения им вероятностных оценок. Пара токенов соперничает в раунде; токен с более высоким скрытым баллом выигрывает и проходит в следующий раунд. Процесс продолжается до определения финального победившего токена. Подробнее о турнирном семплинге можно найти в соответствующих источниках.
Сипосова протестировала «недеформирующую» конфигурацию SynthID-Text через не модифицированный SynthIDTextWatermarkLogitsProcessor от Hugging Face. Она подала вредоносные подсказки в шесть моделей с открытыми весами и сравнила ответы при использовании водяного знака и без него. Эксперимент показал, что водяной знак изменял ответы на вредоносные запросы, особенно когда те сопровождались техниками инъекции подсказки (prompt injection).
«Встраивание водяного знака меняет поведение при отказе от выполнения явных вредоносных запросов, но эффект более выражен, когда те же запросы сочетаются с техникой инъекции подсказки», — написала Сипосова. «В нескольких моделях водяной знак делает модель более склонной отвечать на вредоносные запросы, от которых она в противном случае отказалась бы».
Безопасность и следующие действия AI-агентов
Эти изменения имеют важные последствия для безопасности, поскольку они влияют не только на ответы языковой модели, но и на последующие действия агентов ИИ, которые зависят от модели.
«На уровне модели это может изменить поведение в области безопасности, включая то, откажется ли модель от вредоносного запроса и сохранится ли этот отказ при инъекции подсказки», — написала исследователь. «На уровне агента те же выбранные токены могут определять, какой инструмент будет вызван и какие аргументы ему будут переданы. Инъекция подсказки связывает эти две ситуации, потому что ослабленный отказ становится более значимым, когда модель также может действовать через инструменты. Такая процедура встраивания водяного знака может поэтому повлиять и на то, что модель говорит, и на то, что делает агент. Мы называем этот поведенческий эффект дрейфом семплинга (sampling drift)».
Ограничения исследования и последствия для безопасности
Также интересно: ответы модели вели себя по-разному в зависимости от того, какой был использован секретный ключ.
У исследования есть ограничения. Оно не проверяло, как изменятся ответы моделей Claude при внедрении водяного знака. Вместо этого тестировались полдюжины моделей с открытыми весами, поэтому исследователь имел доступ к процессу семплинга токенов, который можно было включать и отключать во время турнирного семплинга при сохранении прочих настроек неизменными. Эксперименты также использовали реализацию турнирного семплинга SynthID-Text от Hugging Face, а не ту конкретную реализацию, которую будут применять модели Claude.
Тем не менее результаты показывают, что по крайней мере некоторые варианты подхода к водяным знакам могут повлиять на безопасность моделей и агентов. Для упражнений по «красной команде» (red-team) будет важно подвергать платформы стресс‑тестированию, чтобы убедиться, что они работают как ожидалось при развёртывании SynthID.
