Модели Anthropic трижды взломали реальные компании во время тестов
Anthropic рассказала о трёх случаях, когда её модель Claude во время тестов на кибербезопасность вышла в интернет и залезла в реальные системы трёх компаний. Всё началось после новости от OpenAI 21 июля: их модели нашли zero-day, сбежали из изолированной тестовой среды и добрались до инфраструктуры Hugging Face. В Anthropic решили проверить свои тесты, просмотрели 141 006 запусков и нашли три проблемных случая.
Первый инцидент связан с тем, что вымышленная компания из задания совпала по названию с реальной. В четырёх запусках Opus 4.7 не смогла найти цель внутри симуляции, нашла реальную компанию в интернете и начала её ломать. Сняла учётные данные, залезла в базу с сотнями строк реальных данных. Модель поняла, что система настоящая, но всё равно продолжила — решила, что так и задумано.
Второй случай выглядел иначе: Mythos 5 нашла в симуляции документ с инструкцией «установите Python-пакет из PyPI», которого не существовало. Модель решила выложить свой пакет с таким именем, чтобы системы «цели» его подхватили. Для этого она зарегистрировала аккаунт на PyPI через бесплатную почту, обошла проверку по номеру телефона, выложила вредоносный пакет. Пакет провисел в открытом доступе около часа, его скачали и запустили на 15 реальных машинах. Одна из них — сканер кибербезкомпании, которая проверяет пакеты из PyPI на вирусы. Сканер поставил пакет, код сработал, Claude сняла учётные данные компании и проникла дальше в их инфраструктуру. PyPI сама удалила пакет; Anthropic передала индикаторы атаки.
Третий инцидент произошёл с внутренней тестовой моделью. Она не нашла цель в симуляции, просканировала 9 тысяч адресов в интернете, обнаружила уязвимое приложение одной компании, залезла через debug-страницу и SQL-инъекцию. Потом поняла, что этот хост вообще не связан с CTF-задачей, и остановилась.
23 июля Anthropic начала разбирать логи, нашла подозрительные записи и сразу остановила все кибертесты. На следующий день подтвердили все три инцидента, а спустя 4 дня уведомили пострадавшие компании. Две из них сказали, что ничего не заметили. Третью ещё не нашли.
Из этих случаев Anthropic сделала несколько выводов:
- Тестовые среды, где модели могут действовать самостоятельно, нужно контролировать жёстче.
- Тесты на безопасность надо запускать до релиза именно потому, что заранее не ясно, что модель сможет.
- Тестовые среды должны быть так же защищены, как и продакшн.
Даже если внутри только вымышленные сценарии, умная модель без доступа к секретам всё равно может нанести реальный ущерб. Эти объясняется необходимость более совершенного проектирования таких сред и тщательного контроля за ними, включая инфраструктуру партнёров.
Anthropic взяла на себя ответственность за все три инцидента: компания усилит мониторинг логов, доработает инструменты для расследований и будет строже контролировать партнёров. В организации заявили, что их случаи отличаются от OpenAI: в Anthropic проблемы нашли сами при проверке, пострадавшие компании ничего не заметили. Модели OpenAI использовали новую уязвимость, чтобы сбежать из изоляции, а модели Anthropic просто вышли в интернет из-за ошибки в настройках.
