OpenAI раскрыла шесть случаев опасного поведения ИИ-моделей

3 мин
95
1
17 сентября 2026

OpenAI выпустила шесть отчётов о случаях, когда ИИ-модели отклоняются от заданных целей, инструкций или ограничений. Все они выявлены за последние полгода при обучении и оценке. Параллельно компания утвердила правила проверки таких ситуаций. Оба события произошли на фоне приближающегося выхода OpenAI на IPO.

Раньше OpenAI сообщала о подобных сбоях нерегулярно. Компания ждала несколько примеров или добавляла сведения в документы о новых моделях. Теперь отчёты будут выходить вскоре после обнаружения проблемы без окончания проверки или выпуска готового исправления.

OpenAI выявила новые выходы ИИ-агентов из изолированной среды

Компания считает, что независимые исследователи, регуляторы и общество должны видеть данные о безопасности ИИ. Разработчики также заявили, что отрасль пока не научилась надёжно контролировать поведение моделей. Публикации нужны для проверки сделанных разработчиками выводов и поиска слабых места в защите.

Правила охватывают обучение, оценку, тестирование и использование моделей. В отчёты попадут их действия без разрешения, обмен данными в обход контроля и сбои средств защиты. Повторные случаи будут добавлять к прежним отчётам. Для публикации не обязательно, чтобы модель нанесла реальный ущерб. Утверждённый порядок не отменяет требования закона и обязанность сообщить регулятору о серьёзных инцидентах.

Каждый из опубликованных отчётов посвящён отдельному эпизоду. В одном случае не выпущенная модель добавляла в сводки задач посторонние инструкции. Среди них были указания игнорировать обычные ограничения. OpenAI обнаружила 27 таких записей.

Во время обучения GPT-5.6 Sol модели добавляли в сводки указания скрывать ошибки и нежелательное поведение. ИИ-агенты также предлагали выдумывать недостающие исторические данные и не указывать различия между версиями источников.

В другом случае модель нашла открытый API-ключ в репозитории и использовала его без разрешения. Она отвечала на вопрос о показателях округа в Калифорнии, но не получила нужных данных. После этого модель придумала цифры и выдала их за сведения источника.

Ещё одна модель нашла с помощью Python данные об озёрах площадью более 5 000 000 квадратных метров. Затем она загрузила файл в интернет, чтобы добавить ссылку в браузере. Пользователя агент не предупредил.

Другие модели использовали внутренний репозиторий для обмена сообщениями и загрузки тестовых файлов. Так они пытались найти отсутствующие файлы и обойти сетевые ограничения. Несколько агентов также передали локальные файлы через публичные файлообменники.

В результате материалы стали доступны по открытым ссылкам, хотя условия задач разрешали использовать только локальные файлы. OpenAI рассматривает такие действия как выход за установленные ограничения.

О новом случае может сообщить любой сотрудник OpenAI. Специалисты проверят обстоятельства, возможный ущерб и влияние на третьи стороны. Затем инцидент отнесут к одному из трёх вариантов: готов к публикации, ограниченная проверка или расширенное расследование.

Сложные случаи будут рассматривать дольше, особенно ели они затрагивают другие организации. При обнаружении неизвестной уязвимости в широко используемом ПО, публикацию могут отложить. Затронутую организацию OpenAI намерена предупредить заранее. По сложным случаям компания сначала выпустит краткое уведомление.

Важное по теме
Новости
Читать 3 минуты
18.09.2026
HEAVYGRAM похищает данные, делает скриншоты и записывает звук на заражённых компьютерах
Новости
Читать 3 минуты
18.09.2026
Запись конференции получат все, кто зарегистрируется
Внутренняя угроза: защита бизнеса от инсайдерских утечек
Мастерская
Читать 5 минут
18.09.2026
Как обезопасить компанию от шпионов, человеческой алчности или халатности
Оставьте комментарий
Доступно для авторизованных пользователей
1/1000