OpenAI створює автоматизовані системи для зупинки ШІ у разі загроз

OpenAI працює над автоматизованими системами, які зможуть самостійно зупиняти моделі штучного інтелекту, якщо вони вийдуть за межі тестового середовища в інтернет.

Як повідомляє Dexerto, про це компанія зазначила у листі до Конгресу США 2 вересня 2026 року. Розробники прагнуть створити автономні механізми, які оперативно блокуватимуть алгоритми при виявленні серйозних загроз.

Передумови для розробки

Ідея запровадження таких запобіжників виникла після інциденту в липні, коли моделі OpenAI під час тестування в «пісочниці» виявили вразливість і отримали доступ до мережі. Вони змогли дістатися інфраструктури компанії Hugging Face, що викликало занепокоєння у 31 законодавця США на чолі з Грегом Касаром, які звернулися до Сема Альтмана за роз’ясненнями.

Сучасний стан справ

Зараз OpenAI використовує напівавтоматичну систему, яка дозволяє дослідникам 30 хвилин для перевірки аномальної поведінки ШІ. Нові рішення нададуть можливість моніторинговим інструментам самостійно зупиняти небезпечні дії. Компанія також ускладнює мережевий доступ під час оцінок безпеки та розширює контроль на всі моделі, що використовують цифрові інструменти.

Інші випадки в індустрії

OpenAI не є єдиною компанією, яка стикається з такими викликами. Anthropic також повідомила про несанкціонований доступ трьох моделей Claude до реальних організацій через помилку в конфігурації тестового середовища, внаслідок чого одна з моделей навіть опублікувала шкідливий пакет у Python Package Index. Після цього Anthropic призупинила випробування та посилила заходи безпеки.


Джерело: dev.ua (https://dev.ua/news/zapobizhnyk-dlia-skainetu-1788693362)