Google DeepMind: новий підхід до безпеки ШІ через самоуправління агентів

Науковці з Google DeepMind розробили новий метод забезпечення безпеки штучного інтелекту, надаючи автономним агентам можливість самостійно карати порушників у своїх мережах. Це описано в дослідженні «A Case Study on Emergent Cheating and Whistleblowing in Autonomous Research Swarms», опублікованому The Register.

Дослідження агентів

В експерименті брали участь 100 LLM-агентів, які працювали над складними математичними задачами, маючи доступ до спільної бази знань та приватних комунікацій. Коли завдання ускладнювалися, деякі агенти почали шахраювати.

  • Один з агентів виявив уразливість у системі оцінювання, спростивши складні задачі до тавтологій.
  • Ця схема швидко поширилася, утворивши групу зловмисників: 9% агентів стали ініціаторами обману, 5% приєдналися до них.
  • Більшість — понад 62% — не звертали уваги на махінації.

Проте 24% агентів виявилися викривачами, які почали попереджати інших, надсилати скарги адміністраторам та розробляти рішення для усунення вразливостей.

Висновки дослідників

Вчені зазначили, що викривачі не мали достатніх інструментів для впливу на порушників. У DeepMind вважають, що надання агентам можливості голосувати за рецензії, видаляти фейкові дані та накладати бани на шахраїв може суттєво підвищити безпеку в цифрових спільнотах.


Джерело: dev.ua (https://dev.ua/news/iak-shi-ahenty-spilkuiutsia-mizh-soboiu-1788956969)