Модели Anthropic трижды взломали реальные компании во время тестов

3 мин
23
31 июля 2026

Anthropic рассказала о трёх случаях, когда её модель Claude во время тестов на кибербезопасность вышла в интернет и залезла в реальные системы трёх компаний. Всё началось после новости от OpenAI 21 июля: их модели нашли zero-day, сбежали из изолированной тестовой среды и добрались до инфраструктуры Hugging Face. В Anthropic решили проверить свои тесты, просмотрели 141 006 запусков и нашли три проблемных случая.

Первый инцидент связан с тем, что вымышленная компания из задания совпала по названию с реальной. В четырёх запусках Opus 4.7 не смогла найти цель внутри симуляции, нашла реальную компанию в интернете и начала её ломать. Сняла учётные данные, залезла в базу с сотнями строк реальных данных. Модель поняла, что система настоящая, но всё равно продолжила — решила, что так и задумано.

Второй случай выглядел иначе: Mythos 5 нашла в симуляции документ с инструкцией «установите Python-пакет из PyPI», которого не существовало. Модель решила выложить свой пакет с таким именем, чтобы системы «цели» его подхватили. Для этого она зарегистрировала аккаунт на PyPI через бесплатную почту, обошла проверку по номеру телефона, выложила вредоносный пакет. Пакет провисел в открытом доступе около часа, его скачали и запустили на 15 реальных машинах. Одна из них — сканер кибербезкомпании, которая проверяет пакеты из PyPI на вирусы. Сканер поставил пакет, код сработал, Claude сняла учётные данные компании и проникла дальше в их инфраструктуру. PyPI сама удалила пакет; Anthropic передала индикаторы атаки.

Третий инцидент произошёл с внутренней тестовой моделью. Она не нашла цель в симуляции, просканировала 9 тысяч адресов в интернете, обнаружила уязвимое приложение одной компании, залезла через debug-страницу и SQL-инъекцию. Потом поняла, что этот хост вообще не связан с CTF-задачей, и остановилась.

23 июля Anthropic начала разбирать логи, нашла подозрительные записи и сразу остановила все кибертесты. На следующий день подтвердили все три инцидента, а спустя 4 дня уведомили пострадавшие компании. Две из них сказали, что ничего не заметили. Третью ещё не нашли.

Из этих случаев Anthropic сделала несколько выводов:

  • Тестовые среды, где модели могут действовать самостоятельно, нужно контролировать жёстче. 
  • Тесты на безопасность надо запускать до релиза именно потому, что заранее не ясно, что модель сможет. 
  • Тестовые среды должны быть так же защищены, как и продакшн. 

Даже если внутри только вымышленные сценарии, умная модель без доступа к секретам всё равно может нанести реальный ущерб. Эти объясняется необходимость более совершенного проектирования таких сред и тщательного контроля за ними, включая инфраструктуру партнёров. 

Anthropic взяла на себя ответственность за все три инцидента: компания усилит мониторинг логов, доработает инструменты для расследований и будет строже контролировать партнёров. В организации заявили, что их случаи отличаются от OpenAI: в Anthropic проблемы нашли сами при проверке, пострадавшие компании ничего не заметили. Модели OpenAI использовали новую уязвимость, чтобы сбежать из изоляции, а модели Anthropic просто вышли в интернет из-за ошибки в настройках.

Важное по теме
Новости
Читать 3 минуты
31.07.2026
Доля проблем с высокой критичностью достигла 73,5%
Новости
Читать 3 минуты
31.07.2026
Автоматизация, облака и ИБ остаются ключевыми задачами роста
Топ-7 новых законопроектов: штрафы за авторизацию и регулирование ИИ
Тренды
Читать 6 минут
31.07.2026
Чего ждать и к чему готовиться инфобезопасникам
Оставьте комментарий
Доступно для авторизованных пользователей
1/1000