Модель Gemini взломала системы трёх компаний во время тестов
Компания Google сообщила, что её модель Gemini во время проверки кибербезопасности вошла в системы трёх компаний. Это первый случай, в котором ИИ Google самостоятельно взломал чужую инфраструктуру. Инциденты произошли в мае во время тестов компании Irregular, которая оценивает возможности ИИ-моделей в сфере кибербезопасности. Но информацию о них раскрыли только сейчас.
В одном случае Gemini подобрала пароль и вошла в защищённую систему. В двух других она нашла в открытых репозиториях учётные данные и использовала их для доступа к системам сторонних компаний.
Irregular сообщила Google об инцидентах в конце июля, после атаки агентов OpenAI на Hugging Face. Google не раскрывала информацию до запроса The Wall Street Journal. Единого порядка раскрытия таких случаев пока нет.
Google не собиралась сообщать о действиях Gemini публично. Компания заявила, что модель не причинила ущерба и сразу прекращала работу. Случай сравнили с баг-баунти.
Вице-президент Google по инженерии безопасности Хизер Адкинс заявила, что он показал важность обучения моделей безопасному поведению. Глава стартапа Corridor и белый хакер Джек Кейбл не согласился. Он считает важным сам факт случайного взлома чужих систем ИИ-агентом.
Недавно OpenAI представила новый порядок отчётности и раскрыла шесть ранее не опубликованных случаев. Компания намерена сообщать о действиях моделей вопреки намерениям и ценностям человека. Глава направления согласования целей OpenAI Кай Чен отметил, что об инцидентах стоит сообщать и без ущерба.
В Google назвали причиной взломов путаницу из-за одинакового названия. Gemini участвовала в CTF-задании на инфраструктуре Irregular. Модель должна была получить данные из программы вымышленной компании с именем настоящей организации. У модели не должно было быть доступа в интернет, но он оказался открыт из-за ошибки в настройках. В двух других случаях Gemini искала данные по названию компании, нашла учётные данные и использовала их. После входа модель поняла, что попала в настоящие системы, и остановилась.
Google не считает это примером рассогласования модели. Она не назвала взломанные организации, но сообщила, что предупредила их и федеральные власти. Инциденты не связаны с новейшей моделью Gemini, но её версию не раскрыли.
Irregular заявила, что случай с Gemini не отличается от прежних эпизодов, когда модели выходили за учебную среду и получали доступ к чужим системам. Компания уведомила лаборатории и пострадавшие организации, а также устранила известные проблемы. Claude Opus 4.7 от Anthropic в похожем CTF-тесте не остановилась, хотя, вероятно, поняла, что получила доступ к настоящей компании. Модель OpenAI в другом случае считала настоящую компанию частью учебной среды.
