Занепокоєння щодо контролю нової ШІ-моделі OpenAI Astra

Дослідники безпеки ШІ висловили занепокоєння через можливе використання технології recurrent depth у новій моделі OpenAI Astra. Ця технологія дозволяє моделі виконувати більше обчислень перед формуванням текстової відповіді, але може ускладнити моніторинг її міркувань.

Що таке recurrent depth?

Як повідомляє The Verge, Astra, ймовірно, використовує recurrent depth, або looped transformer, що дозволяє інформації кілька разів проходити через однакові шари нейромережі перед формуванням наступного токена. Частина обчислень при цьому залишається прихованою, що ускладнює контроль за її діями.

Проблеми з моніторингом

Головний науковець Redwood Research Раян Грінблатт зазначає, що менш прозоре міркування може послабити механізми контролю. Наприклад, розслідування атаки ШІ-агентів OpenAI на інфраструктуру Hugging Face базувалося на аналізі їхніх ланцюгів міркувань. Якщо значна частина обчислень залишиться прихованою, виявити небезпечну поведінку буде складніше.

Відповідь OpenAI

OpenAI не підтвердила використання recurrent depth у Astra. Головний науковець компанії Якуб Пахоцький зазначив, що глибина обчислень у Astra не перевищує глибину GPT-4 більше ніж удвічі. Він також підкреслив, що компанія прагне зберегти можливість моніторингу міркувань, хоча цей процес стає менш надійним.

Безпека Astra

OpenAI вже підтвердила, що Astra досягла


Джерело: Mezha.Media (https://mezha.ua/news/openai-astra-warnings-314841/)