OpenAI раскрыла шесть случаев опасного поведения ИИ-моделей
OpenAI выпустила шесть отчётов о случаях, когда ИИ-модели отклоняются от заданных целей, инструкций или ограничений. Все они выявлены за последние полгода при обучении и оценке. Параллельно компания утвердила правила проверки таких ситуаций. Оба события произошли на фоне приближающегося выхода OpenAI на IPO.
Раньше OpenAI сообщала о подобных сбоях нерегулярно. Компания ждала несколько примеров или добавляла сведения в документы о новых моделях. Теперь отчёты будут выходить вскоре после обнаружения проблемы без окончания проверки или выпуска готового исправления.
Компания считает, что независимые исследователи, регуляторы и общество должны видеть данные о безопасности ИИ. Разработчики также заявили, что отрасль пока не научилась надёжно контролировать поведение моделей. Публикации нужны для проверки сделанных разработчиками выводов и поиска слабых места в защите.
Правила охватывают обучение, оценку, тестирование и использование моделей. В отчёты попадут их действия без разрешения, обмен данными в обход контроля и сбои средств защиты. Повторные случаи будут добавлять к прежним отчётам. Для публикации не обязательно, чтобы модель нанесла реальный ущерб. Утверждённый порядок не отменяет требования закона и обязанность сообщить регулятору о серьёзных инцидентах.
Каждый из опубликованных отчётов посвящён отдельному эпизоду. В одном случае не выпущенная модель добавляла в сводки задач посторонние инструкции. Среди них были указания игнорировать обычные ограничения. OpenAI обнаружила 27 таких записей.
Во время обучения GPT-5.6 Sol модели добавляли в сводки указания скрывать ошибки и нежелательное поведение. ИИ-агенты также предлагали выдумывать недостающие исторические данные и не указывать различия между версиями источников.
В другом случае модель нашла открытый API-ключ в репозитории и использовала его без разрешения. Она отвечала на вопрос о показателях округа в Калифорнии, но не получила нужных данных. После этого модель придумала цифры и выдала их за сведения источника.
Ещё одна модель нашла с помощью Python данные об озёрах площадью более 5 000 000 квадратных метров. Затем она загрузила файл в интернет, чтобы добавить ссылку в браузере. Пользователя агент не предупредил.
Другие модели использовали внутренний репозиторий для обмена сообщениями и загрузки тестовых файлов. Так они пытались найти отсутствующие файлы и обойти сетевые ограничения. Несколько агентов также передали локальные файлы через публичные файлообменники.
В результате материалы стали доступны по открытым ссылкам, хотя условия задач разрешали использовать только локальные файлы. OpenAI рассматривает такие действия как выход за установленные ограничения.
О новом случае может сообщить любой сотрудник OpenAI. Специалисты проверят обстоятельства, возможный ущерб и влияние на третьи стороны. Затем инцидент отнесут к одному из трёх вариантов: готов к публикации, ограниченная проверка или расширенное расследование.
Сложные случаи будут рассматривать дольше, особенно ели они затрагивают другие организации. При обнаружении неизвестной уязвимости в широко используемом ПО, публикацию могут отложить. Затронутую организацию OpenAI намерена предупредить заранее. По сложным случаям компания сначала выпустит краткое уведомление.
