ИССЛЕДОВАНИЕ · RESEARCH · #613
Исследование: водяной знак SynthID‑Text может менять отказ LLM и вызов инструментов
Новое исследование Андреи Сипосовой из Lasso Security показывает, что водяной знак SynthID‑Text (метод, созданный Google и который Anthropic планирует применять в Claude) может влиять не только на выбор токенов, но и на то, будут ли модели отвергать вредоносные запросы и какие инструменты вызывают агенты, особенно при prompt‑injection. Эксперименты проводились с реализацией Hugging Face на нескольких открытых моделях; в исследовании не тестировали реализацию Anthropic и отмечалось, что поведение зависело от секретного ключа и модели.
КЛЮЧЕВЫЕ ТЕЗИСЫ
- Новое исследование Андреи Сипосовой из Lasso Security показывает, что водяной знак SynthID‑Text (метод, созданный Google и который Anthropic планирует применять в Claude) может влиять не только на выбор токенов, но и на то, будут ли модели отвергать вредоносные запросы и какие инструменты вызывают агенты, особенно при prompt‑injection.
- Эксперименты проводились с реализацией Hugging Face на нескольких открытых моделях; в исследовании не тестировали реализацию Anthropic и отмечалось, что поведение зависело от секретного ключа и модели.
- Поскольку водяной знак, призванный маркировать вывод ИИ, может непреднамеренно ослабить меры безопасности и изменить действия агентов, разработчикам нужно проводить стресс‑тесты и red‑team‑проверки при включённом водяном знаке.
ПОЧЕМУ ЭТО ВАЖНО
Поскольку водяной знак, призванный маркировать вывод ИИ, может непреднамеренно ослабить меры безопасности и изменить действия агентов, разработчикам нужно проводить стресс‑тесты и red‑team‑проверки при включённом водяном знаке.