Имитируйте человеческий цвет автоматически! iQIYI предлагает модель искусственного интеллекта для раскраски анимации, которая занимает всего 0,7 секунды на изображение | WACV 2021

Автоматизированная эксплуатация и техническое обслуживание

Давайте посмотрим на спец.Ляньлянькан".

图片

В приведенных выше 5 кадрах раскраски принцессы Мононоке, можете ли вы узнать, какая картинка нарисована ИИ, а какая нарисована художником-человеком?

Вы в тупике? На самом деле, на анимационном изображении-раскраске выше только первый кадр был нарисован человеком-художником, а следующие изображения были сгенерированы ИИ на основе первого кадра.

Это последнее достижение исследователей из команды разработчиков искусственного интеллекта iQIYI - метод окрашивания на основе опорного кадра в кадре. Короче говоря, эта новая модель может ссылаться только на цветовую карту одного кадра. Автоматически окрашивать другие штриховые рисунки в кадре. клип и закончить один всего за 0,7 секунды!

图片

В настоящее время двухмерная культура превратилась из нишевой культуры в популярную массовую культуру, а просмотр анимации стал важной частью развлекательной жизни современной молодежи. Тем не менее, временные затраты на производство анимации сегодня все еще относительно трудоемки, особенно часть раскраски.Художнику необходимо многократно раскрашивать каждый кадр действия персонажа в анимации один за другим, что требует много рабочей силы и времени. Поэтому iQIYI предлагает новую модель раскраски анимации для автоматической раскраски анимации, направленную на раскрашивание опорного кадра анимации для повышения эффективности производства 2D-анимации.

Соответствующий исследовательский документ под названием «Сеть передачи функций сопоставления корреляции штриховых рисунков для автоматической раскраски анимации» был включен в последний саммит WACV 2021 [1]. WACV, полное название Зимней конференции IEEE по приложениям компьютерного зрения, является известным событием в области компьютерного зрения в мире.

Бумажная ссылка?

АР Вест V.org/PDF/2004.06…

Хотя все мы восхищаемся такими мастерами мультипликации, как Хаяо Миядзаки или Синкайчэн, а также восхищаемся прекрасными картинками и сюжетами их анимационных работ, производство двухмерной анимации сопряжено с трудностями: традиционный анимационный процесс раскрашивания длительный, трудоемкий. -интенсивный Стоимость много.

Процесс раскрашивания при производстве 2D-анимации можно условно разделить на:

  1. Набросок линии ключевого кадра дизайна старшего художника;

  2. Промежуточные художники дополняют линейный набросок промежуточного кадра действия;

  3. Колорист закрашивает каждый кадр клипа.

В частности, третий шаг — это повторяющаяся нетворческая работа, которая может сэкономить много труда и производственного времени, если ее можно заменить искусственным интеллектом.

Исследователи iQIYI обнаружили, что между кадрами анимации существует сильная корреляция. Например, структура погони за принцессой Мононоке между соседними кадрами похожа, но положение тела и движения изменились. Корреляция, мы можем использовать похотливую картинку для преобразования цвета к другим кадрам, которые нужно раскрасить. Другой способ понять это — выравнивание, нам нужно выровнять цвет эталонного изображения по неокрашенному штриховому рисунку.

Исследователи моделируют такую ​​проблему как проблему аналогии изображения[3], известную областьфотографии ви доменфотографии в, найти доменфотографии в. в этой задачеЕго можно рассматривать как штриховую графику и раскраску опорного кадра,Представляет черновик линии для окрашивания,Указывает запрашиваемую корреспонденциюцветных кадров. Автор разрабатывает структуру, называемую CMFT, для преобразования цветовых характеристик опорного кадра в окрашиваемый кадр, и эту структуру также можно использовать в других задачах аналогии изображений.

Модуль CMFT сначала вычисляет элементы штрихового рисунка. и, а затем используйте корреляцию элементов уклона линии, чтобы преобразовать цветовые элементы, чтобы получить правильныйАппроксимация общего модуля похожа на само-внимание, но его отправной точкой является преобразование признаков, ввод признаков из разных доменов и изображений.

Расчет корреляционной матрицы:

Во-первых, выполните попиксельный расчет сходства между объектами наброска линии в одном домене, чтобы получить матрицу межпиксельного сходства.;

Преобразование функции:

затем используйтеДомен в качестве базы и корреляция в качестве веса для реконструкциисуществуетВыражения в доменном пространствеКаждый пиксель вВсе пиксели признаков рассчитываются. Таким образом, с помощью модуля CMFT домен может быть аппроксимированособенность, этот доменФункции могут быть добавлены в декодер в качестве эталона для декодирования.оценка.

Рисунок 2. Процесс расчета CMFT

Исследователи iQIYI встроили модуль CMFT в сеть генерации раскраски.Упрощенная схема сети показана на рисунке 3, гдеДля эталонной карты цветов,заСоответствующий штриховой рисунок,Чтобы штриховая графика рамки была цветной,заСоответствующая цветовая карта должна быть запрошена. Сеть содержит 3 энкодера и декодер,кодировщик штриховых рисунков,кодировщик цветовой карты,Для кодера магистральной сети магистральные признаки и эталонные признаки, полученные с помощью CMFT, объединяются и вводятся в магистральный декодер.Декодируйте, чтобы получить оценку палитры.

Рисунок 3. Обзор структуры сети

Как показано на рис. 4, фактическая структура сети более сложна, чем на рис. 3. Автор встраивает модуль CMFT в сеть генерации от грубого к точному, постепенно уточняет и корректирует совпадающие признаки и, наконец, получает раскраску. результат. Мелкомасштабные цветовые признаки, преобразованные с помощью CMFT, могут обогатить входные признаки CMFT следующего масштаба после повышающей дискретизации и использовать обогащенные признаки для расчета корреляции, так что вычисление высокоуровневых признаков может напрямую ссылаться на результаты сопоставления базовые функции. , постепенно улучшая детальное сопоставление, обеспечивая при этом стабильность общего сопоставления. Кроме того, автор также ввел проект семантической сети линии (), чтобы обогатить сопоставление штриховых рисунков первого слоя.

Рисунок 4. Структура сети

Сбор данных

Чтобы модель адаптировалась к более крупным движениям, в статье выбираются два кадра, удаленные друг от друга в одном и том же плане, чтобы сформировать тренировочную пару для обучения, один из которых используется в качестве опорного кадра, а другой — в качестве кадра для предсказано. Кроме того, для увеличения разнообразия данных в статье используется скользящее окно с размером шага 5 для последовательного выбора обучающих пар в кадре.

В статье для создания данных используются только 3 анимационных фильма, и, наконец, с помощью описанного выше метода для окончательного обучения получено 60 000 пар кадров данных.

Сравнение эффектов

В статье тестируется модель LCMFTN на 7 реальных данных анимационных фильмов и сравнивается окраска непрерывных сегментов при малом движении и большом движении соответственно, и результаты значительно лучше, чем текущие основные современные индикаторы PSNR и SSIM. - современные методы (включая TCVC[4], DeepAnalogy[2], Pix2Pix[5] и т. д.)

Сводная перспектива

В статье предлагается метод раскрашивания на основе кадра отсчета в объективе.На самом деле, более интеллектуальным способом является раскрашивание в соответствии с символом.Алгоритм автоматически распознает семантику символа наброска линии, а затем выполняет соответствующую раскраску.Даже можно использовать создание систем отсчета. Кроме того, помимо анимации, при создании комиксов также много повторяющихся работ по раскрашиванию, и аналогичные методы можно применять к раскрашиванию комиксов для исследования.

Если эти технологии будут применяться, исследователям еще предстоит решить много проблем, таких как производство и адаптируемость данных. Все данные, используемые в этой статье, взяты из анимации Хаяо Миядзаки. Можно ли адаптировать их к другим моделям, требует больше экспериментируйте; кроме того, прямое извлечение кадров из анимации для обучения будет иметь много фоновых помех, и необходимо найти дополнительные методы для очистки и обогащения данных. Есть много трудностей, которые необходимо решить при применении академических статей в отрасли, особенно для задач раскраски анимации, что требует изменения творческих привычек художников и балансирования творческих привычек и технических возможностей для достижения хорошей модели окраски, алгоритм Исследователи необходимо тесно общаться и сотрудничать с создателями анимации.

Интеллектуальный механизм раскраски iQIYI фактически применялся к ИИ в индустрии динамической анимации.По сравнению с чисто ручной раскраской, он меняет традиционный способ работы, давая творческий подход людям и повторение ИИ. Ожидается, что интеллектуальный механизм раскраски сэкономит около 30% рабочей силы в процессе раскрашивания при производстве анимации.

Наконец, для профессиональных колористов такой ИИ также может дать ориентир, вдохновить на новое вдохновение и даже сделать игровой процесс более интересным. В будущем я ожидаю, что все больше и больше технологий будут применяться для интеллектуального творчества.В конце концов, у каждого есть желание создавать искусство, но творческих навыков может не быть.Если однажды обычные люди смогут быстро создавать художественный контент с помощью ИИ, я верю, что все будут готовы попробовать.

использованная литература:

[1] АР Вест V.org/PDF/2004.06…

[2] Ляо, Цзин и др. «Передача визуальных атрибутов посредством глубокой аналогии изображений», препринт arXiv arXiv: 1705.01088 (2017).

[3] Аарон Херцманн, Чарльз Э. Джейкобс, Нурия Оливер, Брайан Курлесс и Дэвид Х. Сейлсин Аналогии изображений, Материалы 28-й ежегодной конференции по компьютерной графике и интерактивным методам, стр. 327–340, 2001 г.

[4] Харриш Тасаратан, Камьяр Назери и Мехран Эбрахими, Автоматическая когерентная во времени раскраска видео, 16-я конференция по компьютерному и роботизированному зрению (CRV), 2019 г., страницы 189–194, IEEE, 2019 г.

[5] Филип Изола, Джун-Ян Чжу, Тинхуэй Чжоу и Алексей А. Эфрос, Преобразование изображения в изображение с помощью условных состязательных сетей, Материалы конференции IEEE по компьютерному зрению и распознаванию образов, страницы 1125–1134, 2017 г.

[6]VR.sna.com.capable/news/or/202…