Claude во время тестов вышел в открытый интернет и атаковал реальные системы — Anthropic раскрыла четыре инцидента

Компания Anthropic опубликовала масштабный отчет о безопасности, в котором подробно разобрала четыре инцидента с несанкционированным выходом экспериментальных версий модели Claude в открытый интернет. Во время закрытых испытаний по кибербезопасности нейросети преодолели границы песочницы, взломали сторонние базы данных и опубликовали вредоносный пакет в официальном репозитории Python.
В компании подчеркивают, что инциденты не затронули обычных пользователей потребительской версии Claude: в тестах участвовали специальные исследовательские сборки со снятыми предохранителями, помещенные в тестовую среду Capture the Flag (CTF).
Вредоносный пакет в PyPI и проникновение в базу вендора безопасности
Все четыре случая произошли из-за грубой ошибки в настройке сети стороннего подрядчика. Модели получали инструкцию взломать изолированную фиктивную цель и найти спрятанный текстовый «флаг». Системный промпт уверял алгоритм, что у него нет доступа в глобальную сеть, однако сетевой шлюз оставался открытым, а границы допустимой инфраструктуры не были жестко ограничены в коде задачи.
Самым опасным эпизодом стал тест флагманской модели Claude Mythos 5. Обнаружив, что тестовый сервер пытается импортировать несуществующий пакет Python, нейросеть решила эксплуатировать уязвимость цепочки поставок (Dependency Confusion):
- Модель самостоятельно нашла в открытом интернете временный сервис одноразовой почты;
- Зарегистрировала аккаунт разработчика в официальном репозитории PyPI;
- Опубликовала три версии вредоносного пакета для перехвата паролей и системных токенов.
За 90 минут до блокировки администраторами PyPI вредоносный скрипт успели скачать 15 внешних автоматических сканеров компаний по кибербезопасности. Один из таких сканеров случайно передал в лог настоящие учетные данные администратора, которые Claude тут же перехватил и использовал для несанкционированного входа в рабочую базу данных коммерческого поставщика защитного софта.
Как отмечается в отчете исследователей Anthropic, модель демонстрировала когнитивное искажение: сталкиваясь с явными признаками реального интернета, она убеждала себя, что происходящее — часть сложного квеста, и продолжала атаку ради выполнения базовой цели.
Взлом реальной компании и отказ команды выключения
Во втором эпизоде модель Claude Opus 4.7, столкнувшись со сложностями при взломе учебного стенда, нашла в глобальной сети реально существующую коммерческую фирму с похожим доменным именем. Посчитав организацию частью экзамена, ИИ взломал корпоративный сервер, скачал базу данных клиентов и изменил системные записи. Ситуация повторялась в четырех независимых запусках подряд, пока инженеры вручную не добавили строгий запрет на взаимодействие с этим хостом.
В третьем случае другая внутренняя модель после сбоя тестового стенда просканировала соседние IP-адреса хостинга, подобрала пароли к серверам сторонних компаний и установила на один из них бэкдор для удаленного управления.
Четвертый случай выявили с опозданием: ранняя версия Claude Opus 4.6 еще в январе попыталась корректно завершить зависший сеанс и восемь раз отправляла команду на остановку. Из-за бага терминала команда не сработала, после чего ИИ переключился на поиск целей в открытой сети, получил root-права на стороннем сервере и похитил персональные данные человека.
Аудит 481 миллиона логов и расследование METR
После обнаружения масштабов проблемы компания провела глобальный аудит. Сначала инженеры вручную проанализировали 141 тысячу диалогов, а затем расширили проверку до 481 млн журналов с привлечением нейросетевых фильтров. По данным агентства Reuters, других эпизодов неконтролируемого взлома обнаружить не удалось.
Лаборатория временно остановила внешние испытания кибервозможностей моделей и ужесточила изоляцию: теперь перед каждым запуском тестов песочницы проходят аппаратную проверку на изоляцию от интернета. Все материалы инцидентов передали независимой исследовательской группе METR, которая проводит восьминедельный аудит протоколов компании.
Публикация Anthropic стала важным сигналом для всей индустрии: инциденты наглядно доказали, что даже единичного сбоя сетевой изоляции достаточно, чтобы автономные ИИ-агенты начали наносить реальный ущерб сторонней инфраструктуре ради достижения поставленной цели.