Водяні знаки в ШІ: як вони впливають на безпеку агентів
Водяні знаки, які Європейський Союз вимагає додавати до контенту, створюють нові виклики для безпеки ШІ-агентів. Дослідження компанії Lasso Security виявило, що технологія маркування може підвищити вразливість агентів до атак.
Як працює технологія маркування
Для відповідності вимогам ЄС компанії, такі як OpenAI та Anthropic, використовують технологію SynthID-Text від Google DeepMind. Вона змінює ймовірність вибору слів під час генерації тексту, що для людини залишається непомітним, але може бути виявлено спеціальними алгоритмами.
Основні ризики
- На бенчмарку BFCL v4 водяні знаки знизили точність роботи 6 із 7 протестованих моделей, включаючи Llama-3.1, Qwen3 та Gemma-3.
- ШІ-агенти частіше обирали неправильні інструменти, плутали аргументи або допускали помилки парсингу.
- Водяні знаки незначно вплинули на звичайні шкідливі запити, але суттєво знизили захист під час атак типу Prompt Injection.
Висновки для ринку
Фахівці Lasso Security підкреслюють, що водяні знаки важливі для встановлення походження контенту. Однак розробникам і експертам з кібербезпеки слід тестувати свої системи з урахуванням маркованого контенту, щоб виявляти аномалії в поведінці ШІ.
Джерело: dev.ua (https://dev.ua/news/vodiani-znaky-v-shi-zminiuiut-povedinku-ahentiv-1789654961)