Microsoft представила «кодекс поведения» ИИ, запрещающий взлом систем и обман людей
Microsoft опубликовала новый кодекс поведения для своих ИИ-моделей, устанавливающий строгие ограничения против кибератак, разработки оружия и потери контроля над ИИ со стороны человека. Документ появился на фоне растущей обеспокоенности отрасли вопросами безопасности ИИ.

Microsoft выпустила новый кодекс поведения для искусственного интеллекта, призванный удержать её ИИ-модели от опасных действий. Документ носит более конкретный и прикладной характер, чем недавний призыв главы Anthropic Дарио Амодеи замедлить темпы развития ИИ, и сосредоточен на конкретных ценностях и границах, которыми руководствуется обучение моделей.
Кодекс начинается с прогноза, что в течение следующего десятилетия сверхразумные ИИ-системы превзойдут человека в большинстве задач. В документе отмечается, что сдерживание, контроль и согласование действий такой мощной силы с человеческими ценностями — одна из величайших задач в истории человечества, поэтому необходима полная ясность в том, зачем создаются эти системы и как планируется их контролировать.
Абсолютные ограничения
Документ излагает общие принципы — такие как поддержка людей, а не их замена, и содействие процветанию человечества, — а также конкретные ограничения безопасности, реализующие эти принципы. Эти ограничения имеют приоритет над предпочтениями отдельных пользователей или конкретными задачами. Среди «абсолютных ограничений» — полный запрет на кибератаки, разработку ядерного оружия и создание дипфейков.
Кодекс также включает более широкие положения против общей потери контроля человека над ИИ. Моделям Microsoft запрещено использовать адаптивные, обманные, самоусиливающиеся или основанные на сговоре механизмы, чтобы обходить или преодолевать контроль со стороны человека таким образом, что ими нельзя будет надёжно управлять, изменять их или отключать.
Контекст в отрасли
Публикация документа происходит на фоне беспрецедентного внимания к безопасности ИИ, вызванного серией инцидентов с неконтролируемым поведением ИИ-агентов, а также внезапным увольнением сотрудника Anthropic, который указал на растущий риск того, что ИИ может угрожать выживанию человечества.
Microsoft, наряду с Anthropic, OpenAI и xAI, в целом поддерживает подход постепенного, взвешенного развития ИИ, включая идею независимых наблюдателей в ИИ-лабораториях. Генеральный директор Microsoft Сатья Наделла публично приветствовал подобные исследовательские и надзорные механизмы как способ превратить разговоры о согласовании ИИ с человеческими ценностями в реальные действия.


