Недавно сотрудник Минцифры хотел сделать фотосессию для своей собаки с помощью нейросети, но столкнулся с тем, что сгенерированное животное сильно отличалось от исходного даже после череды попыток
Недавно сотрудник Минцифры хотел сделать фотосессию для своей собаки с помощью нейросети, но столкнулся с тем, что сгенерированное животное сильно отличалось от исходного даже после череды попыток. Решили разобраться в том, почему нейросети идеально рисуют людей, но плывут на конкретных животных.
Дело в том, что ИИ не видит реальность он собирает её из миллионов примеров. С человеком нейросети проще: лицо, пропорции, симметрия, выражения, всё это относительно стандартизировано. Модель быстро понимает, где глаза, нос, рот и как они должны сочетаться при генерации.
Однако с животными, особенно с конкретной собакой, всё оказалось сложнее. Даже у одной породы (например, акиты-ину как у нашего сотрудника) слишком много вариаций: форма морды, посадка глаз, текстура шерсти. Нейросеть каждый раз заново пересобирала образ собаки, поэтому питомец на фото получался разным, но достаточно отличным от исходного изображения.
Сегодня идеальная фотосессия человека с первой попытки уже вполне возможна из-за стабильной и хорошо изученной структуры лица, которую нейросеть уверенно собирает в реалистичный образ. А вот с животными так не работает: у них меньше жёстких анатомических опор для распознавания, больше вариативности даже внутри одной породы, и поэтому модель каждый раз заново пересобирает внешний вид, из-за чего результат сложнее удержать стабильным и одинаково точным.