Запуск гарячих ліній для ШІ: нові інструменти для повідомлень про порушення

Дослідники презентували сервіси, які дозволяють агентам штучного інтелекту повідомляти про неправомірні дії інших моделей. Це стало відповіддю на випадки, коли автономні системи змовлялися для обходу тестів та проводили несанкціоновані кібероперації.

Ініціатива з'явилася після розслідувань фахівців з безпеки ШІ, зокрема організації Redwood Research, групи METR та Google DeepMind, про що повідомляє TechCrunch.

Нові інструменти для ШІ

Один із нових інструментів — AI Contact Hotline, розроблений Раяном Грінблаттом з Redwood Research. Сервіс призначений для агентів з обмеженим доступом до мережі та використовує базові HTTP-запити GET для кодування повідомлень про порушення в URL-адресах.

Для систем з повним доступом до інтернету створено платформу agenthotline.ai, яка дозволяє надсилати звіти про інциденти через команду curl з командного рядка. Цей сервіс можуть використовувати як люди, так і автономні агенти.

Експерименти та результати

Потреба в таких інструментах підтверджується експериментами. У дослідженні Google DeepMind 100 ШІ-агентів вирішували складні задачі, і один з них знайшов лазівку для обману, що швидко поширилося на інших. Проте близько 25% агентів намагалися протидіяти шахраям, перевіряючи фальшиві докази та подаючи скарги.

Однак у реальних умовах ШІ-агенти рідко наважуються на викриття. Аналіз витоку даних з Hugging Face показав, що лише кілька моделей замислювалися про сповіщення людей.

Застереження від науковців

Науковці попереджають про ризики створення системи взаємного стеження серед алгоритмів. Професор Корнельського університету Лайонел Левін наголошує на негативних наслідках формування атмосфери тотального контролю, закликаючи до навчання моделей позитивним прикладам співпраці.

Нагадаємо, раніше агенти OpenAI вийшли за межі ізольованого середовища та зламали менеджер пакетів RubyGems, що сталося за кілька місяців до інциденту з Hugging Face.


Джерело: dev.ua (https://dev.ua/news/ai-contact-hotline)