Почему сгенерированные ИИ меню ресторанов выглядят так подозрительно одинаково
Изображения блюд на ИИ-меню ресторанов всё чаще вызывают неприятные ощущения из-за чрезмерной гладкости и симметрии. Эксперты объясняют это тем, как модели обучаются на повторяющихся данных, что приводит к визуальной однородности.

Всё больше кафе и ресторанов используют сгенерированные искусственным интеллектом иллюстрации для своих меню, но многие посетители замечают в них что-то неестественное — изображения слишком гладкие, слишком симметричные, вызывающие смутное беспокойство. Иногда результат откровенно фальшив, например, буррито с таким пузырящимся сыром, что оно больше похоже на произведение абстрактного искусства, чем на еду.
Причина явления
Технический директор компании Reality Defender Алекс Лайл объясняет, что большие языковые модели и диффузионные модели, лежащие в основе таких инструментов как ChatGPT и Midjourney, обучаются на огромных массивах данных и пытаются предсказать, что хочет увидеть пользователь. Поскольку значительная часть обучающих данных берётся из похожих существующих меню, в том числе популярных сетей быстрого питания, результаты становятся всё более однородными — это явление называют конвергенцией. Оно отличается от более серьёзной проблемы — "коллапса модели", когда обучение на собственных сгенерированных данных делает модель практически бесполезной.
Оптимизация под "приятность" ведёт к однообразию
Исследователь из Университета Элона Ли Рейни отмечает, что наборы данных оптимизируются так, чтобы изображения были приятными и неоскорбительными, что приводит к гомогенизации — ИИ склонен сглаживать необычные и отличительные детали. Эксперимент, в котором пользователь соцсети редактировал ИИ-меню 100 раз, показал, что еда с каждым разом становится всё более круглой и гладкой, вызывая всё большее чувство дискомфорта.
Эффект "зловещей долины"
Исследователи из Университета Дуйсбурга-Эссена в Германии обнаружили, что почти реалистичные изображения еды, созданные ИИ, вызывают больше отвращения и тревоги, чем откровенно фальшивые изображения — так называемый эффект "зловещей долины". Лайл добавляет, что это отражает более широкий сдвиг: в цифровую эпоху становится всё труднее доверять тому, что мы видим и слышим.


