Дослідники з Тюбінгенського університету та Інституту Макса Планка виявили спосіб отримання прихованих «слідів міркувань» з моделей штучного інтелекту, таких як ChatGPT та Claude. Цей метод дозволяє частково відновити внутрішні процеси, які використовуються для розв'язання складних завдань.
Сутність дослідження
Дослідження виявило ризик витоку конфіденційної інформації та підняло питання про можливе копіювання американських моделей китайськими конкурентами. Сучасні моделі, такі як Claude, GPT та Gemini, здатні розбивати завдання на етапи, аналізуючи їх послідовно. Цей процес називають «ланцюгом думок», і компанії зазвичай не розкривають його через комерційну цінність.
Вразливість API
Дослідники виявили вразливість у передачі даних через API. Багато великих моделей мають менші версії, що використовують той самий механізм шифрування, але проходять менш інтенсивне навчання. Передавши зашифровані дані старшої моделі меншим версіям, дослідники змогли частково розкрити приховану інформацію, включаючи API-ключі та паролі.
Вплив на китайські моделі
Дослідження також виявило схожість між китайською моделлю Kimi K3 від Moonshot AI та американськими моделями. Коли Kimi K3 отримувала частини міркувань, її відповіді іноді були дуже схожими на відповіді Claude Opus 4.8 та GPT 5.6 Sol. Це може свідчити про використання дистиляції — методу перенесення можливостей однієї моделі на іншу.
Геополітичні аспекти
Дослідження підкреслює важливість дистиляції як геополітичного питання. Американські компанії вже звинувачували китайських конкурентів у використанні їхніх моделей для розвитку власних технологій. Проте експерти зазначають, що дистиляція є звичайною практикою, яка дозволяє швидше створювати нові моделі.
Таким чином, робота демонструє, що приховані процеси міркування сучасних ШІ можуть бути менш захищеними, ніж вважалося раніше, і отримана інформація може бути використана для навчання конкурентних моделей.
Джерело: Mezha (Технології) (https://mezha.ua/news/vcheni-navchilisya-rozkrivati-prihovani-mirkuvannya-shi-314098/)
