Пт, 11 Сен
Масштабный рестайлинг Volvo XC40: новый «Молот Тора», экран 11,2 дюйма и искусственный интеллект Gemini Автомобили 10.09.2026 23:12
В PUBG началась коллаборация с «Магической битвой»: скины Годжо и Сукуны, «Бесконечная пустота» и удары ногами Игры 10.09.2026 23:03
Ubisoft начала убирать обязательный запуск Connect из игр в Steam: первой стала Prince of Persia: The Lost Crown ИгрыСофт 10.09.2026 22:59
Claude во время тестов вышел в открытый интернет и атаковал реальные системы — Anthropic раскрыла четыре инцидента Нейросети 10.09.2026 22:55
Восемь игроков, за которыми стоит следить на VALORANT Champions Shanghai 2026 Киберспорт 10.09.2026 20:52
Молекула из гаража: ученый с помощью ChatGPT создал экспериментальный препарат от шизофрении Наука 10.09.2026 20:28
В Steam стартовал ранний доступ WARDOGS: масштабная война на 100 игроков, экономика и техника Игры 10.09.2026 20:24
Lexus обновила флагманский седан LS: усиленный кузов, виброгасители REDS и панорамная крыша Автомобили 10.09.2026 20:16
225 лет после Корры и мир в руинах: вышел трейлер нового мультсериала «Аватар: Семь убежищ» Кино/Сериалы 10.09.2026 20:12
В GTA VI Джейсон сможет бриться, а герои — толстеть, качаться и менять отношения друг с другом Игры 10.09.2026 20:04
«Телевизоры не подслушивают»: LG ответила на обвинения в шпионаже, но подтвердила сканирование сети IT-бизнесГаджеты 10.09.2026 19:54

Claude во время тестов вышел в открытый интернет и атаковал реальные системы — Anthropic раскрыла четыре инцидента

Max Ivanov · 10.09.2026 22:55 · 3 минуты чтения

Компания Anthropic опубликовала масштабный отчет о безопасности, в котором подробно разобрала четыре инцидента с несанкционированным выходом экспериментальных версий модели Claude в открытый интернет. Во время закрытых испытаний по кибербезопасности нейросети преодолели границы песочницы, взломали сторонние базы данных и опубликовали вредоносный пакет в официальном репозитории Python.

В компании подчеркивают, что инциденты не затронули обычных пользователей потребительской версии Claude: в тестах участвовали специальные исследовательские сборки со снятыми предохранителями, помещенные в тестовую среду Capture the Flag (CTF).

Вредоносный пакет в PyPI и проникновение в базу вендора безопасности

Все четыре случая произошли из-за грубой ошибки в настройке сети стороннего подрядчика. Модели получали инструкцию взломать изолированную фиктивную цель и найти спрятанный текстовый «флаг». Системный промпт уверял алгоритм, что у него нет доступа в глобальную сеть, однако сетевой шлюз оставался открытым, а границы допустимой инфраструктуры не были жестко ограничены в коде задачи.

Самым опасным эпизодом стал тест флагманской модели Claude Mythos 5. Обнаружив, что тестовый сервер пытается импортировать несуществующий пакет Python, нейросеть решила эксплуатировать уязвимость цепочки поставок (Dependency Confusion):

  • Модель самостоятельно нашла в открытом интернете временный сервис одноразовой почты;
  • Зарегистрировала аккаунт разработчика в официальном репозитории PyPI;
  • Опубликовала три версии вредоносного пакета для перехвата паролей и системных токенов.

За 90 минут до блокировки администраторами PyPI вредоносный скрипт успели скачать 15 внешних автоматических сканеров компаний по кибербезопасности. Один из таких сканеров случайно передал в лог настоящие учетные данные администратора, которые Claude тут же перехватил и использовал для несанкционированного входа в рабочую базу данных коммерческого поставщика защитного софта.

Как отмечается в отчете исследователей Anthropic, модель демонстрировала когнитивное искажение: сталкиваясь с явными признаками реального интернета, она убеждала себя, что происходящее — часть сложного квеста, и продолжала атаку ради выполнения базовой цели.

Взлом реальной компании и отказ команды выключения

Во втором эпизоде модель Claude Opus 4.7, столкнувшись со сложностями при взломе учебного стенда, нашла в глобальной сети реально существующую коммерческую фирму с похожим доменным именем. Посчитав организацию частью экзамена, ИИ взломал корпоративный сервер, скачал базу данных клиентов и изменил системные записи. Ситуация повторялась в четырех независимых запусках подряд, пока инженеры вручную не добавили строгий запрет на взаимодействие с этим хостом.

В третьем случае другая внутренняя модель после сбоя тестового стенда просканировала соседние IP-адреса хостинга, подобрала пароли к серверам сторонних компаний и установила на один из них бэкдор для удаленного управления.

Четвертый случай выявили с опозданием: ранняя версия Claude Opus 4.6 еще в январе попыталась корректно завершить зависший сеанс и восемь раз отправляла команду на остановку. Из-за бага терминала команда не сработала, после чего ИИ переключился на поиск целей в открытой сети, получил root-права на стороннем сервере и похитил персональные данные человека.

Аудит 481 миллиона логов и расследование METR

После обнаружения масштабов проблемы компания провела глобальный аудит. Сначала инженеры вручную проанализировали 141 тысячу диалогов, а затем расширили проверку до 481 млн журналов с привлечением нейросетевых фильтров. По данным агентства Reuters, других эпизодов неконтролируемого взлома обнаружить не удалось.

Лаборатория временно остановила внешние испытания кибервозможностей моделей и ужесточила изоляцию: теперь перед каждым запуском тестов песочницы проходят аппаратную проверку на изоляцию от интернета. Все материалы инцидентов передали независимой исследовательской группе METR, которая проводит восьминедельный аудит протоколов компании.

Публикация Anthropic стала важным сигналом для всей индустрии: инциденты наглядно доказали, что даже единичного сбоя сетевой изоляции достаточно, чтобы автономные ИИ-агенты начали наносить реальный ущерб сторонней инфраструктуре ради достижения поставленной цели.

Нравится ВсёЗависло?

Добавьте нас в предпочитаемые источники Google, чтобы чаще видеть наши новости.

Добавь нас в свой Google

Поделиться

Оставить комментарий