Tech Meridian ← К ЛЕНТЕ
EN

ИССЛЕДОВАНИЕ · RESEARCH · #613

Исследование: водяной знак SynthID‑Text может менять отказ LLM и вызов инструментов

Новое исследование Андреи Сипосовой из Lasso Security показывает, что водяной знак SynthID‑Text (метод, созданный Google и который Anthropic планирует применять в Claude) может влиять не только на выбор токенов, но и на то, будут ли модели отвергать вредоносные запросы и какие инструменты вызывают агенты, особенно при prompt‑injection. Эксперименты проводились с реализацией Hugging Face на нескольких открытых моделях; в исследовании не тестировали реализацию Anthropic и отмечалось, что поведение зависело от секретного ключа и модели.

КЛЮЧЕВЫЕ ТЕЗИСЫ

  1. Новое исследование Андреи Сипосовой из Lasso Security показывает, что водяной знак SynthID‑Text (метод, созданный Google и который Anthropic планирует применять в Claude) может влиять не только на выбор токенов, но и на то, будут ли модели отвергать вредоносные запросы и какие инструменты вызывают агенты, особенно при prompt‑injection.
  2. Эксперименты проводились с реализацией Hugging Face на нескольких открытых моделях; в исследовании не тестировали реализацию Anthropic и отмечалось, что поведение зависело от секретного ключа и модели.
  3. Поскольку водяной знак, призванный маркировать вывод ИИ, может непреднамеренно ослабить меры безопасности и изменить действия агентов, разработчикам нужно проводить стресс‑тесты и red‑team‑проверки при включённом водяном знаке.

ПОЧЕМУ ЭТО ВАЖНО

Поскольку водяной знак, призванный маркировать вывод ИИ, может непреднамеренно ослабить меры безопасности и изменить действия агентов, разработчикам нужно проводить стресс‑тесты и red‑team‑проверки при включённом водяном знаке.

ИСТОЧНИКИ И ХРОНОЛОГИЯ

1