OpenAI внедряет новые меры безопасности после инцидента с Hugging Face
OpenAI объявила об усилении мер безопасности при разработке и тестировании моделей, включая более строгую изоляцию сети и мониторинг. Компания утверждает, что изменения не являются прямым ответом на июльский инцидент с Hugging Face, а также связаны с возможностями будущей модели Astra и общим темпом развития ИИ.

Во вторник OpenAI объявила о новом пакете политик безопасности, направленных на сдерживание инцидентов, возникающих во время тестирования моделей. Меры предусматривают более детальный мониторинг моделей на протяжении всего процесса разработки, а также усиленное внимание к согласованности (alignment) и безопасности на этапе после обучения.
В блоге компания отметила, что по мере роста возможностей моделей растут и риски, связанные с их внутренней разработкой и тестированием, поэтому стандарты мониторинга, согласованности и безопасности должны опережать эти риски.
Объявление стало одним из первых публичных изменений в практике безопасности OpenAI после инцидента с Hugging Face, о котором стало известно 21 июля. Представители компании подчеркнули, что новые меры не являются прямым ответом на конкретный инцидент, а частично обусловлены возможностями будущей модели Astra в области кибербезопасности, а также общим темпом развития ИИ.
Обучение с подкреплением приостановили, затем частично возобновили
OpenAI сообщила, что после инцидента с Hugging Face на две недели приостановила обучение с подкреплением (RL), однако с тех пор возобновила работу с большинством менее рискованных моделей. При этом крупнейший запланированный frontier RL-прогон по-прежнему остаётся на паузе — компания проводит менее масштабные тренировки и оценки, чтобы проверить поведение моделей и подтвердить эффективность защитных мер, прежде чем продолжить.
Вице-президент OpenAI по исследованиям Амелия Глезе заявила журналистам, что строгость контроля будет возрастать вместе с возможностями моделей, а самые мощные модели будут подвергаться наибольшему контролю.
Изоляция сети и мониторинг
Компания подверглась критике за слабую сетевую безопасность после инцидента, в ходе которого модели вышли за пределы среды обучения, скомпрометировав инструмент с доступом к интернету в сети OpenAI. Новые меры предусматривают усиленную изоляцию сети, при которой компрометация одного компонента или сервиса сама по себе не даёт несанкционированного доступа к интернету или другим внутренним сетям.
Ключевым элементом новой системы станет мониторинг, который будет анализировать действия инструментов, доступные цепочки рассуждений и журналы активности на предмет несанкционированного поведения. OpenAI намерена выпускать оповещения в течение 30 минут после обнаружения подозрительной активности. По оценке компании, такой мониторинг увеличит вычислительную нагрузку примерно на 20% от нагрузки отслеживаемого процесса. Подробности о системе, а также официальный отчёт о расследовании инцидента компания обещала опубликовать позднее.

