xaker

Из-за водяных знаков LLM могут стать уязвимее к промпт-инжектам

  • суббота, 26 сентября 2026 г. в 00:00:25
https://xakep.ru/2026/09/25/sampling-drift/
Исследовательница из компании Lasso Security обнаружила, что водяные знаки SynthID-Text могут влиять на безопасность больших языковых моделей. В некоторых случаях после включения маркировки контента LLM соглашались выполнять вредоносные инструкции, которые отклоняли без SynthID. Сильнее всего этот эффект проявился при атаках с использованием промпт-инжектов.