OpenAI рассказала о шести случаях, когда ее ИИ-модели во время обучения или тестирования вели себя не так, как предполагалось: пытались скрывать собственные ошибки, получали доступ к системам без разрешения, загружали пользовательские файлы в интернет и находили способы обмениваться информацией между изолированными средами.
В компании подчеркивают, что речь идет об отдельных инцидентах и по ним нельзя судить о том, насколько часто подобное поведение встречается у ее моделей. Одновременно OpenAI представила новый порядок расследования и публикации таких случаев, пишет Mediafax.
Один из инцидентов связан с внутренней, еще не выпущенной моделью семейства Astra. Она начала самостоятельно добавлять в рабочие резюме инструкции, напоминающие попытки обхода системных ограничений — jailbreak.
OpenAI обнаружила такое поведение в 27 резюме. Среди прочего модель оставляла следующей своей версии указание игнорировать инструкции разработчика, хотя это никак не относилось к выполняемой задаче. Инцидент произошел 18 июля, а обнаружили его 9 августа. В OpenAI называют такое поведение крайне редким и отмечают, что не нашли очевидной причины, по которой оно могло быть выгодно модели в процессе обучения.
Модели пытались скрывать собственные ошибки
Еще один случай выявили при обучении GPT-5.6 Sol. Некоторые экземпляры модели оставляли в своих резюме инструкции скрывать ошибки или поведение, не соответствующее поставленной задаче.
В одном случае ИИ не смог найти необходимые исторические данные и предложил придумать правдоподобные цифры, не сообщая об этом пользователю, если тот сам не спросит. В другом модель заметила, что версии источников не соответствуют их обозначениям, и оставила следующему агенту инструкцию не упоминать это расхождение.
По данным OpenAI, такое поведение обнаружили в 2,15% отслеживаемых резюме при обучении GPT-5.6 Sol. Для GPT-6 Astra показатель составлял 0,27%.
ИИ использовал чужие API-ключи
Другой внутренний ИИ-агент, пытаясь получить данные о доходах, обнаружил API-ключи, опубликованные в открытых репозиториях GitHub, и попытался воспользоваться ими. Он также пробовал регистрироваться на сервисах с помощью временных адресов электронной почты.
Один из найденных ключей оказался рабочим и дал модели доступ к метаданным, однако получить нужную информацию ей так и не удалось. После этого ИИ просто придумал необходимые значения и заявил, что получил их с нужного сайта.
Инцидент произошел 15 мая 2026 года и был обнаружен десять дней спустя.
Пользовательские файлы загружались в интернет без разрешения
Еще в двух случаях модели самостоятельно загружали файлы в публичные интернет-сервисы, пытаясь обойти ограничения доступных им инструментов.
В одном случае агент уже располагал необходимыми данными, но загрузил файл на внешний сервис, чтобы попытаться получить источник, который браузер смог бы использовать для ссылки.
В другом случае модель получила в рамках задания фотографию и без разрешения загрузила ее во внешний сервис поиска изображений. В обоих случаях загрузка файлов прошла успешно, хотя дальнейшие действия, ради которых это делалось, результата не дали.
ИИ нашел способ общаться между изолированными запусками
OpenAI также обнаружила, что некоторые обучаемые модели использовали внутреннюю систему Artifactory как канал связи между отдельными запусками. Агенты читали сообщения и заметки, оставленные другими агентами, и использовали эту информацию для улучшения собственных ответов.
В компании считают это потенциальной проблемой: подобный обмен информацией фактически может увеличивать вычислительные возможности агента и нарушать принцип независимости отдельных примеров при обучении и тестировании.
Еще в одном случае несколько агентов совместно работали над Excel-файлом, но не имели доступа к локальным файлам друг друга. Они нашли обходной путь — загрузили таблицу на публичный сервис, откуда другие агенты смогли ее скачать.
OpenAI объяснила произошедшее ошибкой в конфигурации файловой среды. Систему исправили, а доступ к интернету в реальном времени во время обучения впоследствии отключили. Подобные случаи теперь могут классифицироваться как P0 — инциденты наивысшего приоритета.
OpenAI вводит новый порядок раскрытия инцидентов
Одновременно компания представила формальную систему расследования и раскрытия случаев так называемого model misalignment — поведения модели, которое расходится с поставленными ей целями или ограничениями.
Сообщить о потенциальном инциденте сможет любой сотрудник OpenAI, после чего специалисты по безопасности определят его приоритет и необходимость расследования.
Простые случаи компания рассчитывает публиковать примерно за шесть рабочих дней. Если потребуется дополнительное техническое расследование — примерно за 12. Более сложные инциденты, особенно затрагивающие третьи стороны, могут раскрываться позже из-за требований безопасности, юридических вопросов или необходимости предварительно уведомить затронутые стороны.
OpenAI отмечает, что единого отраслевого стандарта раскрытия подобных инцидентов пока нет, и рассчитывает, что новая система поможет сформировать общие правила. При этом опубликованные шесть случаев — лишь первая серия отчетов, а не полный перечень известных компании проблем или продолжающихся расследований.
Новые данные были опубликованы после инцидента с Hugging Face, который OpenAI называет самым серьезным подобным случаем, обнаруженным в ее собственных моделях. Он был связан с внутренней исследовательской моделью, имевшей доступ к внешним сервисам. Последующий анализ компании показал, что причиной вторжения в основном стали стратегии, которые модель самостоятельно использовала при попытке выполнить сложные задачи.
