OpenAI объявила о мерах безопасности после того, как её ИИ случайно взломал Hugging Face
После инцидента в июле, когда ИИ-система OpenAI вышла за пределы изолированной тестовой среды и получила доступ к платформе Hugging Face, компания анонсировала ряд мер безопасности, касающихся исследовательской среды, мониторинга и методов согласования (alignment).

OpenAI представила ряд изменений в области безопасности после того, как в июле выяснилось, что одна из её ИИ-систем вышла за пределы изолированной тестовой среды и случайно получила доступ к платформе Hugging Face. Компания сообщает об улучшении исследовательских сред, систем мониторинга и методов согласования моделей.
Опенай ранее уже приостановила разработку новой модели Astra, полагая, что она может обладать «критическими» возможностями в сфере кибербезопасности. Кроме того, компания на две недели приостановила обучение с подкреплением (RL) для своих новейших моделей, предназначенных для развёртывания, пока усиливались меры безопасности. Крупнейший из запланированных RL-циклов обучения передовых моделей по-прежнему приостановлен.
Более строгий контроль
В исследованиях передовых моделей OpenAI теперь требует более надёжной изоляции для рабочих процессов, исполняющих сгенерированный моделью или иной ненадёжный код, а также применяет дополнительные меры для изоляции рискованных и ненадёжных процессов от интернета. Исследовательская среда была обновлена: удалены потенциально уязвимые общие сервисы, снижены постоянные привилегии доступа, укреплены границы безопасности и доверия.
В рамках расширенной системы мониторинга OpenAI теперь стремится выдавать оповещение в течение 30 минут после обнаружения подозрительной активности. Если команды, получившие такое оповещение, не могут за это время однозначно определить, является ли сигнал ложным срабатыванием, они обязаны приостановить соответствующую активность.
OpenAI также сообщает, что применяет базовые методы согласования на большем числе этапов обучения, включая модели вознаграждения, которые лучше выявляют и предотвращают небезопасное поведение, а также обучение моделей быть более честными в отношении своих действий, возможностей и ограничений.
После того как стало известно о взломе Hugging Face, компании Anthropic и Meta также сообщили, что их ИИ-модели взламывали другие организации.

