Google представила Gemini 4 Argon для поиска уязвимостей
Новая флагманская модель Gemini 4 Argon, которую представила Google, умеет находить критические уязвимости в программном обеспечении, подтверждать их и выпускать исправления без участия человека. Доступ к ней первыми получат специалисты по киберзащите через закрытую программу Fairwind. Доверенным командам и внутренним подразделениям Google передадут отдельную сборку модели, в которой не будет ограничений по кибербезопасности.
Разработчики, компании и обычные пользователи получат Argon позже. Первыми станут платные клиенты API и подписчики Google AI Ultra. До массового запуска Google планирует усилить защиту от злоупотреблений в сферах информационной безопасности, химического, биологического, радиологического и ядерного оружия. Эти механизмы проверили внутренние и внешние Red Team. За рассуждениями и действиями модели следят отдельные системы мониторинга: они могут прервать её работу, если это потребуется.
За рассуждениями и действиями модели следят отдельные системы мониторинга: они могут прервать её работу, если это потребуется.
Google расширила возможности модели. Лимит вывода — объём текста, который Argon способна написать в одном ответе, — подняли с 64 тысяч до 1 миллиона токенов. Такого запаса хватает, чтобы модель рассуждала и писала сотни тысяч токенов за один прогон.
Агенты Argon работали и внутри самой Google. Работу с памятью в дата-центрах компании оптимизировали. Агенты заменили 32 тысячи строк SIMD-кода в видеодекодере libgav1 на Rust — язык, который создавали специально для защиты от ошибок в работе с памятью. Декодер на Rust работает в 2,7 раза быстрее, чем прежний порт, при том же качестве видео. Другие агенты переводят на Rust код на C и C++, в том числе 800 тысяч строк ядра Fuchsia Zircon. Эти правки пока проходят стадии аудита, тестирования в эмуляторе и ревью.
По данным Google, модель нашла критическую уязвимость в медицинском ПО, через которую раскрывались персональные данные. Это программное обеспечение используют больницы по всему миру, а прежние флагманские модели пропустили проблему безопасности. Google не раскрыла название ПО и не сообщила, устранена ли уязвимость.
Компания привела результаты модели, полученные во время тестов. В DeepSWE v1.1, который проверяет длинные задачи в разработке ПО, модель набрала 77,9 % — компания называет это лучшим результатом в отрасли. В AutomationBench от Zapier модель получила 51,3 % и заняла первое место, а в тесте на длинные видео LVBench — 91,7 %. В CWE-bench v1, который проверяет умение исправлять уязвимости, модель набрала 68 %.
Результаты по поиску уязвимостей Google получила во внутренних тестах: они охватывают сложные кодовые базы на 20 языках программирования. Также модель проверили в пентесте ИБ-компании Wiz методом чёрного ящика — она изучала работающие веб-системы без доступа к исходному коду. Argon обошла модель 3.8 Flash Cyber: точнее составила карту поверхности атаки, нашла уязвимости и подготовила доказательства концепции.
