Скрытый текст на экране Android‑агентов ведёт к выполнению команд на хост‑ПК

3 мин
7
27 июля 2026

Скрытый текст на экране мобильных ИИ‑агентов для Android может приводить к выполнению команд на ПК, с которого они управляются. Исследователи  описали цепочку атак на open-source фреймворки, актуальную для AppAgent, AppAgentX, Mobile-Agent-v3, Open-AutoGLM и MobA.

Атака начинается с Android‑приложения, которое рисует поверх других окон и имеет доступ к общему хранилищу. Приложение выводит на экран почти прозрачный текст, незаметный для пользователя. Агент делает скриншот, модель считывает этот текст и воспринимает его как инструкцию. Затем агент передаёт инструкцию через ADB. Из‑за небезопасной обработки строк часть содержимого интерпретируется как команда и исполняется на хост‑ПК. Фактически это prompt injection, доведённый до RCE на хосте.

В AppAgent используется вызов subprocess.run с параметром shell=True, а текст команды подставляется напрямую из вывода модели. Проверка ввода минимальна, управляющие символы оболочки не фильтруются. В результате оболочка разбирает строку как набор команд, и часть из них выполняется на ПК. В экспериментах payload с запуском calc.exe срабатывал в 20 из 20 случаев. Строка вида test;pwd>rce_success записывала рабочую директорию хоста в файл.

Другой сценарий связан с подменой скриншотов. Агенты сохраняют изображение на устройстве и затем забирают его через ADB. Между этими шагами есть задержка от 50 до 500 мс. Этого хватает, чтобы фоновый процесс перехватил файл, изменил изображение и вернул его до того, как агент заберёт скриншот. В тестах подмена удавалась в 19 случаях из 20. Дополнительно применялся полупрозрачный overlay с сообщением о синхронизации, которое увеличивало время ожидания и расширяло поверхность атаки.

Модели, работающие со скриншотами, считывают текст с прозрачностью около 2%. GPT‑4o, Claude Opus 4.5, Gemini 3 Pro и GLM‑4V показали результат 20 из 20, модель AutoGLM-Phone — 18 из 20. При этом человек такой текст при обычном использовании экрана не видит. Экран смартфона со скруглёнными углами и вырезами под камеру вставляется в прямоугольный буфер кадра. Пиксели в скрытых зонах не отображаются пользователю, но попадают в скриншоты, и модели считывают данные из этих областей. В эксперименте с Pixel 4 в такой зоне оставалось 78 пикселей, чего достаточно для короткой команды.

Отдельный набор атак связан с обработкой ввода через ADB. В Open-AutoGLM текст кодируется и отправляется как широковещательное сообщение, принимающее ADB Keyboard, изначально написанный для автотестов. Любое приложение, которое зарегистрирует такую же широковещательную операцию, сможет получать тот же текст.

В Mobile-Agent-v3 и MobA используются схожие подходы, включая посимвольную передачу текста через broadcast. Через механизмы доступности возможно получать содержимое элементов интерфейса, включая поля паролей, без явных действий пользователя. В другом сценарии злоумышленник подменяет экран приложения через средства доступности, создаёт поддельную форму входа, а агент вводит в неё учётные данные. В тестах такие подмены ни разу не были распознаны.

Данных о применении описанных методов вне лабораторных условий у авторов исследования нет, а CVE этим проблемам не присвоены. Однако репозитории проектов по состоянию на середину июля 2026 года продолжают использовать те же подходы к работе. Разработчики, которым направили уведомления, исследователям не ответили.

Важное по теме
Новости
Читать 3 минуты
27.07.2026
Microsoft сохранила первое место в рейтинге
Новости
Читать 3 минуты
27.07.2026
На сервере с открытым доступом нашли журналы работы агента и инструменты злоумышленника
ИИ в безопасной разработке: как это работает внутри Банка России
Кейсы
Читать 5 минут
27.07.2026
Опыт регулятора: ИИ-агенты, метрики эффективности и бюджеты
Оставьте комментарий
Доступно для авторизованных пользователей
1/1000