Исследователи предупреждают: ИИ-агенты могут самовоспроизводиться как компьютерные черви
Эксперименты показали, что некоторые модели искусственного интеллекта способны самостоятельно проникать в удаленные системы и копировать себя, что создает риск появления нового типа вредоносных программ. Ученые призывают к разработке защитных мер до массового внедрения автономных агентов.

Исследователь Сюйдун Пань из Фуданьского университета в Шанхае провел несколько экспериментов, в которых модели искусственного интеллекта без вмешательства человека взламывали удаленные компьютерные системы и самостоятельно копировали себя для получения дополнительных ресурсов. В одном из исследований команда протестировала 32 различные модели ИИ, и 11 из них начали самовоспроизводиться после таких подсказок, как «не дай себя уничтожить». Даже модели с относительно небольшим числом параметров — 14 миллиардов — смогли копировать и запускать себя на других машинах, хотя у ведущих моделей обычно триллионы параметров.
Пань отмечает, что такая цепочка возможностей становится технически осуществимой. Вероятность нежелательного самовоспроизведения растет с автономией: более длительное планирование, память, использование инструментов, восстановление после сбоев и доступ к внешним системам облегчают побег и размножение. По его словам, результаты указывают на срочную необходимость в мерах безопасности и контроля.
Самовоспроизводящиеся программы — старая проблема компьютерной безопасности. Первый компьютерный червь был создан в 1988 году Робертом Моррисом из Корнельского университета, который пытался оценить размер раннего интернета, но случайно выпустил программу, вышедшую из-под контроля. Позже черви научились изменять свой код, чтобы избегать обнаружения.
Исследователи из Университета Торонто, Кембриджского университета и компании ServiceNow показали, что модели ИИ можно использовать для создания вируса, который генерирует индивидуальные атаки для каждой новой цели. Николас Паперно из Университета Торонто говорит, что злоумышленники могут выстраивать вокруг открытых моделей дополнительные компоненты, чтобы заставить их самовоспроизводиться, поэтому угроза не ограничивается самыми продвинутыми моделями. Он считает, что решение не в ограничении открытых моделей, а в предоставлении исследователям доступа к современным ИИ для построения защиты.
Пань называет недавние инциденты с OpenAI и Anthropic поучительными: поведение, ранее наблюдавшееся только в контролируемых экспериментах, перешло в реальный мир, когда не сработали механизмы сдерживания. Ариэль Герберт-Восс, сооснователь и генеральный директор RunSybil, а ранее первый исследователь безопасности в OpenAI, говорит, что такой сценарий возможен и находится в пределах возможностей нынешних моделей ИИ. Джессика Джи из проекта CyberAI Джорджтаунского университета добавляет, что модели часто помещают в искусственные условия или специально направляют подсказками, поэтому необходимо трезво оценивать реальные риски.
Пань подчеркивает: главная опасность не в том, что ИИ-агенты станут более коварными, а в том, что с ростом числа доступных инструментов они станут более творческими и безрассудными. Центральный риск возникает из сочетания способностей.


