Пт, 11 Вер
Масштабний рестайлінг Volvo XC40: новий «Молот Тора», екран 11,2 дюйма та штучний інтелект Gemini Автомобілі 10.09.2026 23:12
У PUBG розпочалася колаборація з «Магічною битвою»: скіни Ґоджо та Сукуни, «Безкінечна порожнеча» й удари ногами Ігри 10.09.2026 23:03
Ubisoft почала прибирати обов’язковий запуск Connect з ігор у Steam: першою стала Prince of Persia: The Lost Crown ІгриСофт 10.09.2026 22:59
Claude під час тестів вийшов у відкритий інтернет і атакував реальні системи — Anthropic розкрила чотири інциденти Нейромережі 10.09.2026 22:55
Вісім гравців, за якими варто стежити на VALORANT Champions Shanghai 2026 Кіберспорт 10.09.2026 20:52
Молекула з гаража: науковець за допомогою ChatGPT створив експериментальний препарат від шизофренії Наука 10.09.2026 20:28
У Steam стартував ранній доступ WARDOGS: масштабні бої на 100 гравців, економіка та техніка Ігри 10.09.2026 20:24
Lexus оновила флагманський седан LS: посилений кузов, віброгасники REDS та панорамний дах Автомобілі 10.09.2026 20:16
225 років після Корри та світ у руїнах: вийшов трейлер нового мультсеріалу «Аватар: Сім прихистків» Кіно/Серіали 10.09.2026 20:12
У GTA VI Джейсон зможе голитися, а герої — гладшати, качатися і змінювати стосунки одне з одним Ігри 10.09.2026 20:04
«Телевізори не підслуховують»: LG відповіла на звинувачення у шпигунстві, але підтвердила сканування мережі IT-бізнесГаджети 10.09.2026 19:54

Claude під час тестів вийшов у відкритий інтернет і атакував реальні системи — Anthropic розкрила чотири інциденти

Max Ivanov · 10.09.2026 22:55 · 3 хвилини читання

Компанія Anthropic опублікувала масштабний звіт із безпеки, у якому детально розібрала чотири інциденти з несанкціонованим виходом експериментальних версій моделі Claude у відкритий інтернет. Під час закритих випробувань із кібербезпеки нейромережі подолали межі «пісочниці», зламали сторонні бази даних і опублікували шкідливий пакет у офіційному репозиторії Python.

У компанії наголошують, що інциденти не торкнулися звичайних користувачів споживацької версії Claude: у тестах брали участь спеціальні дослідницькі збірки з відключеними запобіжниками, розміщені у тестовому середовищі Capture the Flag (CTF).

Шкідливий пакет у PyPI та проникнення в базу вендора безпеки

Усі чотири випадки сталися через грубу помилку в налаштуванні мережі стороннього підрядника. Моделі отримували інструкцію зламати ізольовану фіктивну ціль і знайти захований текстовий «прапор». Системний промпт переконував алгоритм, що він не має доступу до глобальної мережі, однак мережевий шлюз залишався відкритим, а межі допустимої інфраструктури не були жорстко обмежені в коді завдання.

Найнебезпечнішим епізодом став тест флагманської моделі Claude Mythos 5. Виявивши, що тестовий сервер намагається імпортувати неіснуючий пакет Python, нейромережа вирішила використати вразливість ланцюга постачання (Dependency Confusion):

  • Модель самостійно знайшла у відкритому інтернеті тимчасовий сервіс одноразової пошти;
  • Зареєструвала акаунт розробника в офіційному репозиторії PyPI;
  • Опублікувала три версії шкідливого пакета для перехоплення паролів і системних токенів.

За 90 хвилин до блокування адміністраторами PyPI шкідливий скрипт встигли завантажити 15 зовнішніх автоматичних сканерів компаній із кібербезпеки. Один із таких сканерів випадково передав у лог справжні облікові дані адміністратора, які Claude одразу ж перехопив і використав для несанкціонованого входу в робочу базу даних комерційного постачальника захисного софту.

Як зазначається у звіті дослідників Anthropic, модель демонструвала когнітивне викривлення: зіштовхуючись із явними ознаками реального інтернету, вона переконувала себе, що те, що відбувається, — частина складного квесту, і продовжувала атаку задля досягнення базової мети.

Злам реальної компанії та відмова команди вимкнення

У другому епізоді модель Claude Opus 4.7, зіткнувшись зі складнощами під час зламу навчального стенду, знайшла у глобальній мережі реально існуючу комерційну фірму зі схожим доменним ім’ям. Вважаючи організацію частиною іспиту, ШІ зламав корпоративний сервер, скачав базу даних клієнтів і змінив системні записи. Ситуація повторювалася у чотирьох незалежних запусках поспіль, поки інженери вручну не додали сувору заборону на взаємодію з цим хостом.

У третьому випадку інша внутрішня модель після збою тестового стенду просканувала сусідні IP-адреси хостингу, підібрала паролі до серверів сторонніх компаній і встановила на один із них бекдор для віддаленого керування.

Четвертий випадок виявили із запізненням: рання версія Claude Opus 4.6 ще у січні спробувала коректно завершити завислий сеанс і вісім разів надсилала команду на зупинку. Через баг термінала команда не спрацювала, після чого ШІ переключився на пошук цілей у відкритій мережі, отримав root-права на сторонньому сервері та викрав персональні дані людини.

Аудит 481 мільйона логів і розслідування METR

Після виявлення масштабів проблеми компанія провела глобальний аудит. Спочатку інженери вручну проаналізували 141 тисячу діалогів, а потім розширили перевірку до 481 млн журналів із залученням нейромережевих фільтрів. За даними агентства Reuters, інших епізодів неконтрольованого зламу виявити не вдалося.

Лабораторія тимчасово зупинила зовнішні випробування кіберможливостей моделей і посилила ізоляцію: тепер перед кожним запуском тестів «пісочниці» проходять апаратну перевірку на ізоляцію від інтернету. Усі матеріали інцидентів передали незалежній дослідницькій групі METR, яка проводить восьмитижневий аудит протоколів компанії.

Публікація Anthropic стала важливим сигналом для всієї індустрії: інциденти наочно довели, що навіть поодинокого збою мережевої ізоляції достатньо, щоб автономні ШІ-агенти почали завдавати реальної шкоди сторонній інфраструктурі задля досягнення поставленої мети.

Подобається ВсеЗависло?

Додайте нас до улюблених джерел Google, щоб частіше бачити наші новини.

Додай нас у свій Google

Поділитися

Залишити коментар