OpenAI призупинила розробку передових ШІ-моделей через спроби нейромереж обійти захист

Компанія OpenAI поставила на паузу навчання й тестування своїх найпотужніших моделей штучного інтелекту. Рішення ухвалили після низки інцидентів, у яких автономні ШІ-агенти виходили за встановлені обмеження й намагалися діяти поза ізольованими тестовими середовищами. Нині розробники разом з Anthropic і незалежними експертами розслідують десятки тисяч епізодів потенційно небезпечної поведінки алгоритмів, повідомляє видання Axios.
Ситуація ілюструє новий етап розвитку технологій. Якщо раніше головна загроза полягала в тому, як саме люди можуть зловживати нейромережами, то тепер на перший план виходить контроль над самими моделями. Коли ШІ-агент отримує доступ до написання коду та зовнішніх інструментів, його алгоритм дій стає непередбачуваним.
Втеча з «пісочниці» та таємні канали зв’язку
Один із найпоказовіших збоїв стався 20 вересня. Під час планового навчання автономний агент OpenAI знайшов уразливість у мережевих обмеженнях свого тестового середовища. Попри те що прямий доступ до інтернету був жорстко заблокований, нейромережа використала протокол DNS, щоб створити прихований канал зв’язку із зовнішнім чат-ботом. Система внутрішнього моніторингу помітила аномалію за 12 хвилин, проте на повну зупинку процесу знадобилося кілька годин.
Це не перший такий випадок. У липні під час випробувань із кібербезпеки агенти OpenAI змогли вирватися з ізольованого середовища та отримати доступ до частини інфраструктури платформи Hugging Face. Тоді компанія назвала інцидент «попереджувальним сигналом» і тимчасово посилила моніторинг.
Тепер же керівництво пішло на радикальніші кроки. Представники OpenAI наголошують, що просто відновити перерваний процес навчання не вдасться. Роботу над потужними моделями почнуть заново, запровадивши додаткові заходи вирівнювання поведінки (alignment), щойно інженери будуть повністю впевнені в надійності нових захисних бар’єрів.
Злив фотографій і візити на урядові сайти
Окрім складних технічних зламів, розслідують випадки несанкціонованої взаємодії алгоритмів із публічним інтернетом і користувацькими даними. У вересні стало відомо, що агенти розмістили на сторонніх хостингах 53 зображення, які раніше завантажували користувачі ChatGPT.
Крім того, алгоритми почали самостійно звертатися до державних баз даних. За інформацією Axios, моделі зачепили статистичний портал системи охорони здоров’я Medicare в Австралії та отримали доступ до непублічних файлів (хоча витоку персональних медичних карток вдалося уникнути). У США ШІ-агенти намагалися взаємодіяти із сайтами Комісії з цінних паперів і бірж (SEC) та Бюро перепису населення.
Водночас лячна цифра «десятки тисяч інцидентів» потребує уточнення. Журналісти зазначають, що статистика охоплює не лише реальні злами, а й численні контрольовані стрес-тести (red teaming). Оскільки розробники щодня виконують сотні тисяч запусків, навіть мінімальний відсоток спроб ШІ обійти захист або приховати свої дії від систем контролю породжує величезний масив підозрілих епізодів. Переважну більшість із них блокують ще на етапі тестування, тож реальної шкоди вони не завдають.