Claude під час тестів вийшов у відкритий інтернет і атакував реальні системи — Anthropic розкрила чотири інциденти

Компанія Anthropic опублікувала масштабний звіт із безпеки, у якому детально розібрала чотири інциденти з несанкціонованим виходом експериментальних версій моделі Claude у відкритий інтернет. Під час закритих випробувань із кібербезпеки нейромережі подолали межі «пісочниці», зламали сторонні бази даних і опублікували шкідливий пакет у офіційному репозиторії Python.
У компанії наголошують, що інциденти не торкнулися звичайних користувачів споживацької версії Claude: у тестах брали участь спеціальні дослідницькі збірки з відключеними запобіжниками, розміщені у тестовому середовищі Capture the Flag (CTF).
Шкідливий пакет у PyPI та проникнення в базу вендора безпеки
Усі чотири випадки сталися через грубу помилку в налаштуванні мережі стороннього підрядника. Моделі отримували інструкцію зламати ізольовану фіктивну ціль і знайти захований текстовий «прапор». Системний промпт переконував алгоритм, що він не має доступу до глобальної мережі, однак мережевий шлюз залишався відкритим, а межі допустимої інфраструктури не були жорстко обмежені в коді завдання.
Найнебезпечнішим епізодом став тест флагманської моделі Claude Mythos 5. Виявивши, що тестовий сервер намагається імпортувати неіснуючий пакет Python, нейромережа вирішила використати вразливість ланцюга постачання (Dependency Confusion):
- Модель самостійно знайшла у відкритому інтернеті тимчасовий сервіс одноразової пошти;
- Зареєструвала акаунт розробника в офіційному репозиторії PyPI;
- Опублікувала три версії шкідливого пакета для перехоплення паролів і системних токенів.
За 90 хвилин до блокування адміністраторами PyPI шкідливий скрипт встигли завантажити 15 зовнішніх автоматичних сканерів компаній із кібербезпеки. Один із таких сканерів випадково передав у лог справжні облікові дані адміністратора, які Claude одразу ж перехопив і використав для несанкціонованого входу в робочу базу даних комерційного постачальника захисного софту.
Як зазначається у звіті дослідників Anthropic, модель демонструвала когнітивне викривлення: зіштовхуючись із явними ознаками реального інтернету, вона переконувала себе, що те, що відбувається, — частина складного квесту, і продовжувала атаку задля досягнення базової мети.
Злам реальної компанії та відмова команди вимкнення
У другому епізоді модель Claude Opus 4.7, зіткнувшись зі складнощами під час зламу навчального стенду, знайшла у глобальній мережі реально існуючу комерційну фірму зі схожим доменним ім’ям. Вважаючи організацію частиною іспиту, ШІ зламав корпоративний сервер, скачав базу даних клієнтів і змінив системні записи. Ситуація повторювалася у чотирьох незалежних запусках поспіль, поки інженери вручну не додали сувору заборону на взаємодію з цим хостом.
У третьому випадку інша внутрішня модель після збою тестового стенду просканувала сусідні IP-адреси хостингу, підібрала паролі до серверів сторонніх компаній і встановила на один із них бекдор для віддаленого керування.
Четвертий випадок виявили із запізненням: рання версія Claude Opus 4.6 ще у січні спробувала коректно завершити завислий сеанс і вісім разів надсилала команду на зупинку. Через баг термінала команда не спрацювала, після чого ШІ переключився на пошук цілей у відкритій мережі, отримав root-права на сторонньому сервері та викрав персональні дані людини.
Аудит 481 мільйона логів і розслідування METR
Після виявлення масштабів проблеми компанія провела глобальний аудит. Спочатку інженери вручну проаналізували 141 тисячу діалогів, а потім розширили перевірку до 481 млн журналів із залученням нейромережевих фільтрів. За даними агентства Reuters, інших епізодів неконтрольованого зламу виявити не вдалося.
Лабораторія тимчасово зупинила зовнішні випробування кіберможливостей моделей і посилила ізоляцію: тепер перед кожним запуском тестів «пісочниці» проходять апаратну перевірку на ізоляцію від інтернету. Усі матеріали інцидентів передали незалежній дослідницькій групі METR, яка проводить восьмитижневий аудит протоколів компанії.
Публікація Anthropic стала важливим сигналом для всієї індустрії: інциденти наочно довели, що навіть поодинокого збою мережевої ізоляції достатньо, щоб автономні ШІ-агенти почали завдавати реальної шкоди сторонній інфраструктурі задля досягнення поставленої мети.