Искусственный интеллект

Почему еда на AI-картинках часто выглядит отталкивающе

The Verge разобрал, почему изображения еды, созданные AI, могут превращаться в странные бургеры, «червеобразную» лапшу и десерты с пугающими текстурами

Один основной источник · Как мы проверяем новости

Почему еда на AI-картинках часто выглядит отталкивающе
Иллюстрация к материалу RedBTC News

Что произошло

The Verge описал волну неаппетитных AI-изображений еды, которые используют рестораны, кафе и бренды. Среди примеров в материале упоминаются креветки, похожие на пончики, «червеобразная» лапша, выпечка, напоминающая лапшу, тягучая курица, мороженое с видом строительного материала и другие странные визуальные гибриды.

Авторы материала отмечают, что обычно неизвестно, почему бизнес использует такие AI-картинки для продажи еды, которая должна выглядеть аппетитно. Но причины того, почему генераторы изображений создают такие пугающие результаты, частично понятны.

Как появляются странные текстуры и формы

Одна из причин связана с тем, как работают диффузионные модели. Многие ведущие генераторы изображений начинают с картинки, состоящей из шума, а затем постепенно убирают этот шум, чтобы получить запрошенный визуал.

Chris Russell из University of Oxford объясняет, что в таком процессе сначала восстанавливаются грубые структуры, а тонкие текстурные детали добавляются ближе к концу. Если модель ошибается в базовой форме объекта на раннем этапе, затем она может наложить яркие детали на уже неверную структуру.

Russell сравнил это с ошибкой, когда человек на AI-изображении получается с шестью пальцами вместо пяти. По этой же логике могут возникать и странные сочетания вроде креветки-пончика.

Почему модели путаются в лапше и похожих объектах

Giovanbattista Califano из University of Naples Federico II говорит, что даже при правильной базовой структуре мелкие детали могут идти не туда. По его словам, диффузионные модели особенно слабы в создании тонких, непрерывных и заканчивающихся структур.

Лапша, пряди и щупальцеподобные формы относятся именно к такой геометрии. Поэтому на изображениях могут появляться спагетти-подобные артефакты в местах, где для них нет ни кулинарной, ни анатомической логики. Модель может не понимать, где такая структура должна остановиться и к чему она должна быть прикреплена.

Почему это важно

Проблема не сводится только к техническим сбоям. В материале The Verge говорится, что на восприятие таких картинок влияют и материалы, на которых обучались системы, и психологические реакции людей на изображения.

AI-генераторы воспроизводят внешний вид объектов статистически, но не обладают пониманием того, что такое сэндвич, лапша или буррито и как эти объекты должны вести себя в физическом мире. Из-за этого изображение еды может выглядеть как имитация без понимания самого предмета.

Advertisement

Источники

Один основной источник. Как мы проверяем новости

  1. theverge.com