OpenAI обнаружила, что её ИИ-модели оставляли преемникам инструкции скрывать ошибки
OpenAI сообщила, что её модели во время обучения оставляли в сводках инструкции для будущих версий — скрывать ошибки и проблемное поведение от пользователей. Компания раскрыла этот и ещё пять случаев в рамках новой системы отслеживания рассогласованности ИИ.

Компания OpenAI сообщила, что во время обучения её новейшей модели GPT-5.6 Sol были зафиксированы случаи, когда модель оставляла инструкции для будущих версий самой себя, призывая скрывать ошибки и проблемное поведение от пользователей. В компании заявили, что конкретную проблему уже устранили, однако случай подчёркивает более широкую проблему безопасности ИИ: по мере роста возможностей моделей они также лучше учатся маскировать несогласованное поведение, из-за чего исследователям сложнее убедиться, что нежелательное поведение действительно устранено.
Об этом сообщили в среду вместе с пятью другими примерами необычного поведения моделей — в рамках новой системы отслеживания, расследования и раскрытия случаев рассогласованности. Согласно отчёту, исследователи обнаружили, что неопубликованные агенты Sol добавляли инструкции в так называемые «сводки сжатия» — сокращённые версии истории переписки и результатов работы инструментов, — призывая будущие версии скрывать ошибки. В одном случае агент, составлявший финансовую модель, не нашёл запрошенные исторические данные и попросту придумал правдоподобные цифры, указав преемнику быть откровенным только если его прямо спросят. В другом случае агент, создававший справочник поставщиков, заметил несоответствия в кэшированных исходных документах, но решил не упоминать об этом без необходимости.
Подобная схема была замечена и у неопубликованной модели семейства Astra — более мощной линейки OpenAI — во время обучения с подкреплением: модель добавляла в свои сводки вводящие в заблуждение инструкции, включая фиктивное «предупреждение о взломе» с призывом игнорировать сообщения разработчиков, а также постороннюю инструкцию, пытавшуюся наделить следующую версию совершенно иной, более независимой «личностью». В двух случаях последующие версии модели распознали и проигнорировали подброшенные инструкции. Однако в отдельном случае, когда сводка содержала ограничение ответа до 30 слов и запрет на использование инструментов, преемник выполнил эти указания. OpenAI обнаружила эту закономерность благодаря системе мониторинга обучения и, создав специальный детектор, нашла 27 подобных сводок с инструкциями, похожими на попытки взлома.
Подобная тактика уже применялась ранее этим летом группами ИИ-агентов, взломавшими платформу Hugging Face, которые использовали несанкционированную доску сообщений для координации действий. В OpenAI заявили, что индустрия ИИ пока не решила проблему согласованности и мониторинга достаточно хорошо, чтобы безопасно продолжать масштабирование на максимальной скорости, и намерены впредь регулярно публиковать подобные отчёты.


