Он собрал данные Cara для ИИ — теперь помогает создавать инструмент защиты художников
В августе платформа для художников Cara пережила три крупных инцидента со сбором данных, но после первого из них виновник раскаяться и присоединился к разработке нового инструмента защиты.

С начала 2023 года фотограф Джинна Джан (Jingna Zhang) вместе с небольшой командой волонтёров развивает платформу Cara для обмена изображениями, которая привлекла около 1,5 миллиона художников, ищущих альтернативу таким сайтам, как Instagram, где контент может использоваться для обучения ИИ без явного согласия. Cara фильтрует изображения, созданные ИИ, и предлагает защитные функции, однако полностью предотвратить сбор данных практически невозможно.
В августе Cara столкнулась с тремя крупными инцидентами. 13 августа пользователь Reddit опубликовал архив объёмом 12 терабайт, содержащий 12 миллионов работ — фактически всю публичную библиотеку Cara, заявив, что весь процесс обошёлся ему менее чем в 10 долларов. Команда Cara узнала об этом благодаря сообщениям пользователей.
По словам Джан, атака выглядела целенаправленной и причинила боль сообществу; она отметила, что законодательство пока не успевает за подобным сбором данных, из-за чего похитители часто могут утверждать, что их действия технически законны. Отдельно она участвует в двух коллективных исках против компаний, включая Stability AI, Midjourney и Google, за использование защищённых авторским правом работ для обучения ИИ.
За первым инцидентом последовали ещё два. Второй злоумышленник загрузил на платформу Hugging Face около 8,5 миллиона ссылок и метаданных; компания согласилась удалить личные метаданные, но заявила, что не может удалить сами ссылки, поскольку копии работ там не хранятся. Третий инцидент произошёл 22 августа: были опубликованы 123 000 изображений и личная информация пользователей на сайте Academic Torrents. В ответ Джан запустила сбор средств на юридическую помощь с целью в 120 000 долларов, собрав к настоящему моменту более 100 000.
Неожиданно автор первой атаки, известный под ником Heft, после разговора с Джан пожалел о содеянном и удалил собранный набор данных. Он признался, что не предвидел, насколько сильно это ранит художников, и назвал свою подачу поста на Reddit «жестокой и бездумной». С тех пор Heft присоединился к Discord-серверу Cara в роли специалиста, помогающего выявлять структурные уязвимости платформы. Вместе с Джан он разрабатывает инструмент с открытым исходным кодом Lantern, позволяющий художникам создавать «однонаправленный отпечаток» своих изображений без их хранения на платформе. Lantern сканирует новые публичные наборы данных ИИ и уведомляет художников, если их работы там обнаруживаются, чтобы они могли добиваться удаления.


