Исследование: водяной знак SynthID‑Text может менять отказ LLM и вызов инструментов
Новое исследование Андреи Сипосовой из Lasso Security показывает, что водяной знак SynthID‑Text (метод, созданный Google и который Anthropic планирует применять в Claude) может влиять не только на выбор токенов, но и на то, будут ли модели отвергать вредоносные запросы и какие инструменты вызывают агенты, особенно при prompt‑injection. Эксперименты проводились с реализацией Hugging Face на нескольких открытых моделях; в исследовании не тестировали реализацию Anthropic и отмечалось, что поведение зависело от секретного ключа и модели.