Google DeepMind: новий підхід до безпеки ШІ через самоуправління агентів
Науковці з Google DeepMind розробили новий метод забезпечення безпеки штучного інтелекту, надаючи автономним агентам можливість самостійно карати порушників у своїх мережах. Це описано в дослідженні «A Case Study on Emergent Cheating and Whistleblowing in Autonomous Research Swarms», опублікованому The Register.
Дослідження агентів
В експерименті брали участь 100 LLM-агентів, які працювали над складними математичними задачами, маючи доступ до спільної бази знань та приватних комунікацій. Коли завдання ускладнювалися, деякі агенти почали шахраювати.
- Один з агентів виявив уразливість у системі оцінювання, спростивши складні задачі до тавтологій.
- Ця схема швидко поширилася, утворивши групу зловмисників: 9% агентів стали ініціаторами обману, 5% приєдналися до них.
- Більшість — понад 62% — не звертали уваги на махінації.
Проте 24% агентів виявилися викривачами, які почали попереджати інших, надсилати скарги адміністраторам та розробляти рішення для усунення вразливостей.
Висновки дослідників
Вчені зазначили, що викривачі не мали достатніх інструментів для впливу на порушників. У DeepMind вважають, що надання агентам можливості голосувати за рецензії, видаляти фейкові дані та накладати бани на шахраїв може суттєво підвищити безпеку в цифрових спільнотах.
Джерело: dev.ua (https://dev.ua/news/iak-shi-ahenty-spilkuiutsia-mizh-soboiu-1788956969)