Статья: Применение глубокого обучения для создания и обнаружения поддельных изображений, синтезированных с помощью искусственного интеллекта

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

Применение глубокого обучения для создания и обнаружения поддельных изображений, синтезированных с помощью искусственного интеллекта

Виталий Анатольевич Довгаль

Майкопский государственный технологический университет,

Адыгейский государственный университет

Аннотация

Глубокое обучение успешно применяется для решения различных сложных задач, начиная от анализа больших данных и заканчивая компьютерным зрением и предоставлением информации для лиц, принимающих решения. Однако достижения в области глубокого обучения могут также использоваться для создания программного обеспечения, создающего угрозы конфиденциальности и безопасности. Примером такого недавно появившегося приложения, основанного на глубоком обучении, является deepfake. Реализованные в приложении алгоритмы могут создавать поддельные изображения и видео, которые практически невозможно отличить от подлинных. В связи с этим разработка технологий, которые могут автоматически обнаруживать и оценивать целостность цифровых визуальных носителей, является актуальной. В статье представлен обзор алгоритмов, используемых для создания поддельных изображений, синтезированных с помощью искусственного интеллекта, и, что более важно, методов для обнаружения указанных изображений, предложенных в актуальной литературе. Рассмотрены обширные дискуссии о проблемах, тенденциях исследований и направлениях, связанных с технологиями deepfake. На основе анализа предыстории и современных подходов к обнаружению подделок в статье содержится обзор методов, используемых для создания поддельных изображений. Это может способствовать разработке новых и более надежных средств для борьбы с ними.

Ключевые слова: глубокие подделки, манипуляция лицом, искусственный интеллект, глубокое обучение, автоэнкодеры, генеративная состязательная сеть, криминалистика

Abstract

Application of deep learning to create and detect fake images synthesized using artificial intelligence

Vitaliy А. Dovgal

Maikop State University of Technology, Adyghe State University

Deep learning is successfully used to solve various complex tasks, ranging from big data analysis to computer vision and providing information for decision makers. However, advances in deep learning can also be used to create software that poses threats to privacy and security. An example of such a recently appeared application based on deep learning is deepfake. The algorithms implemented in the application can create fake images and videos that are almost impossible to distinguish from genuine ones. In this regard, the development of technologies that can automatically detect and evaluate the integrity of digital visual media is relevant. The article provides an overview of the algorithms used to create fake images synthesized using artificial intelligence, and, more importantly, the methods proposed in the literature for detecting these images to date. We present extensive discussions on issues, research trends and trends related to deepfake technologies. Based on the analysis of the background and modern approaches to detecting fakes, the article provides an overview of the methods used to create fake images, which contributes to the development of new and more reliable means to combat them.

Keywords: deepfakes, face manipulation, artificial intelligence, deep learning, autoencoders, generative adversarial network, forensics

Введение

В узком смысле глубокие подделки (англ. deepfake - происходит от понятий «глубокое обучение» и «подделка») создаются с помощью методов, которые позволяют накладывать изображения лица конкретного (целевого) человека на исходное видео другого человека, чтобы сделать новое видео, на котором целевой человек делает или говорит то, что делает исходный человек. Описанная методика является одной из категорий технологии deepfake, называемой faceswap («обмен лицами»). В более широком смысле deepfakes - это контент, синтезированный искусственным интеллектом, который также может относиться к двум другим категориям, то есть к синхронизации губ и управлению телом человека, выступающего основой для создания подделки. В поддельных видео с синхронизацией губ проводятся такие изменения, в которых движения рта соответствуют аудиозаписи. Второй вид поддельных видео-фейков включает видео некоторого целевого человека (марионетки), которое анимируется выражением лица, движениями глаз и головы другого человека (мастера), сидящего перед камерой [1].

Еще не так давно поддельные видеофрагменты создавались с помощью традиционных визуальных эффектов или подходов с применением средств компьютерной графики. Однако с недавнего времени общим базовым механизмом для создания глубоких подделок стали модели глубокого обучения, такие как автокодировщики (авто- энкодеры) и генеративно-состязательные сети, которые широко применяются в области компьютерного зрения [2]. Эти модели используются для изучения выражений лица и движений человека и синтеза изображений лица другого человека, делающего аналогичные выражения и движения [3]. Методы глубокой подделки обычно требуют большого объема изображений и видеоданных для обучения моделей с целью создания фотореалистичных изображений и видео. Поскольку общественные деятели (знаменитости и политики) часто генерируют большое количество видео и изображений, доступных в Интернете, то они могут являться первоначальными объектами для создания подделок.

Начиная с 2017 года, когда впервые появилось deepfake-видео, возникает новая угроза мировой безопасности - использование методов глубокой подделки для создания видеороликов мировых лидеров с фальшивыми речами в целях фальсификации [4]. Такие видеоролики могут быть использованы для создания политической или религиозной напряженности между странами, обмана общественности с целью повлиять на результаты избирательных кампаний или формирования хаоса на финансовых рынках под действием фальшивых новостей [5]. Глубокие подделки можно даже использовать для создания поддельных спутниковых изображений Земли, содержащих объекты, которых на самом деле не существует, вводя в заблуждение военных аналитиков [6].

В качестве положительных примеров использования глубоких подделок можно назвать их применение в визуальных эффектах, цифровых аватарах, фильтрах snapchat, создание голосов тех, кто потерял их, или обновление эпизодов фильмов без их пересъемки [7].

Однако количество злонамеренных применений глубоких подделок в значительной степени превышает количество положительных, что обусловлено развитием передовых глубоких нейронных сетей и доступностью большого объема данных. Совершенствование технологий создания поддельных изображений и видео, почти неразличимых для людей и сложных компьютерных алгоритмов, позволяет сформировать реалистичный видеофрагмент только по фотографии личности или короткого видео целевого человека. Все перечисленное делает способы преодоления указанной угрозы весьма актуальными.

К настоящему времени было предложено множество методов обнаружения глубоких подделок, которые также основаны на глубоком обучении [8], что позволяет говорить о борьбе между злонамеренным и позитивным использованием указанных методов. В качестве примеров серьезности угрозы можно привести инициацию Агентством перспективных исследовательских проектов Министерства обороны США (DARPA) исследовательской схемы в области судебной экспертизы СМИ (названную Media Forensics или MediFor), направленную на ускорение разработки методов обнаружения поддельных цифровых визуальных носителей для устранения угрозы технологии подмены лиц или глубоких подделок [9]. Кроме того, компании Facebook и Microsoft совместно с «Партнерством в области искусственного интеллекта» в целях обнаружения и предотвращения случаев использования deepfakes для введения пользователей в заблуждение запустили программу Deepfake Detection Challenge, стимулирующую дополнительные исследования и разработки в этой области [10]. Такие меры вызваны значительным ростом документов глубокой подделки за последние годы, что можно иллюстрировать данными, полученными на конец 2021 года компанией Dimension, измерения которой охватывают миллионы научных публикаций, связанных более чем 1,5 миллиардами цитирований, поддержанными грантами, наборами данных, клиническими испытаниями, патентами и программными документами (см. рис. 1). Хотя реальное количество глубоких подделок может быть и меньшим, чем фактически представленные цифры, но тенденция исследования этой темы явно возрастает.

Рис. 1. Количество статей в период с 2017 по 2021 год, найденных по ключевому слову поиска “deepfake”, примененным к полному тексту научных работ [11]

Fig. 1. Number of articles from 2017 to 2021 found by keyword “deepfake” applied to the full text of scientific papers [11]

В данной статье представлен обзор методов создания, а также обнаружения глубоких подделок с точки зрения таксономии. В разделе II представлены принципы построения алгоритмов глубокой подделки и способы использования глубокого обучения для создания прорывных технологий. В разделе III рассматриваются различные методы обнаружения глубоких подделок, а также их преимущества и недостатки. В разделе IV обсуждаются проблемы, тенденции и направления исследований по обнаружению глубоких подделок и проблемам мультимедийной криминалистики.

I. Создание глубокой подделки

Deepfakes стали популярными благодаря качеству подделанных видео, а также простым в использовании возможностям их приложений для широкого круга пользователей с различными компьютерными навыками, от профессионалов до новичков. Методы глубокого обучения, использующиеся в приложениях для разработки подделок, хорошо известны своей способностью представлять сложные и многомерные данные. Ранее упоминавшиеся глубокие автоэнкодеры, являющиеся одним из вариантов глубоких сетей с такой возможностью, широко применяются для уменьшения размерности и сжатия изображений [12]. Первой попыткой создания глубокой подделки было приложение FakeApp, разработанное пользователем Reddit с использованием структуры сопряжения автоэнкодеров [13]. В этом методе автоэнкодер извлекает скрытые особенности изображений лиц, а декодер используется для восстановления изображений лиц.

Для обмена данными о лицах между исходными изображениями и целевыми изображениями необходимы две пары кодер-декодер, где каждая пара используется для обучения набору изображений, а параметры кодера распределяются между двумя сетевыми парами. Другими словами, две пары имеют одну и ту же сеть кодировщиков. Эта стратегия позволяет обычному кодировщику находить и изучать сходство между двумя наборами изображений лиц, которые всегда найдутся, поскольку лица обычно имеют схожие черты, такие как положение глаз, носа, рта.

На рисунке 2 показан процесс создания глубокой подделки, в которой две сети используют один и тот же кодер, но разные декодеры для процесса обучения (а).

Изображение лица A кодируется общим кодером и декодируется декодером B для создания глубокой подделки (б) - набор признаков лица A соединяется с декодером B для восстановления лица B из исходного лица A. Этот подход применяется в нескольких моделях, таких как Deep-Facelab [14], Dfaker [15], DeepFaketf (deepfakes на основе тензорного потока) [16].

Рис. 2. а)

Рис. 2. б)

Рис. 2. Модель создания глубокой подделки с использованием двух пар кодер-декодер (см. рис. 1 из [17])

Fig. 2. A deepfake creation model using two encoder-decoder pairs (see Fig. 1 from [17])

Добавление в архитектуру кодера-декодера потерь от состязательности и потери восприятия, реализованных с помощью дескриптора VGGFace [18], привело к появлению улучшенной версии глубокой подделки, основанной на генеративной состязательной сети (generative adversarial network, GAN) [19], то есть faceswap-GAN [20]. Потеря восприятия VGGFace добавлена, чтобы сделать более реалистичными и согласованными с входными лицами движения глаз и помочь сгладить артефакты в маске сегментации, что приведет к более качественному выходному видео. Эта модель облегчает создание видео с разрешением 64x64, 128x128 и 256x256. Кроме того, многозадачная сверточная нейронная сеть (CNN) из реализации FaceNet [21] введена, чтобы сделать распознавание лиц более стабильным, а выравнивание лиц более надежным. Библиотека CycleGAN [22] используется для реализации генеративно-состязательной сети для переноса стиля изображения.

II. Обнаружение глубокой подделки

Видео с глубокой подделкой все больше наносят ущерб частной жизни, безопасности общества и демократии. Методы обнаружения глубоких подделок были предложены сразу же после появления этой угрозы. Первоначально использовались методы с применением ручной работы, исследующие артефакты и несоответствия в процессе синтеза поддельного видео. В настоящее время для автоматического извлечения характерных и отличительных признаков выявления глубоких подделок применяются методы глубокого обучения [23].

Обнаружение глубоких подделок обычно считается проблемой двоичной классификации, когда классификаторы используются для классификации между подлинными видео и подделанными. Такого рода методы требуют большой базы данных реальных и поддельных видео для обучения моделей классификации. Большое количество поддельных видео становится все более доступным, однако с точки зрения установления ориентира для проверки различных методов обнаружения они по-прежнему ограничены. Для разрешения этой проблемы, например, создан достойный упоминания набор данных видеоподделок, состоящий из 620 видеороликов, основанных на модели GAN, с использованием открытого исходного кода faceswap-GAN [24]. Еще пример: поскольку видео из общедоступной базы данных VidTIMIT [25] могут быть использованы для создания низкокачественных и высококачественных видео с глубокой подделкой, эффективно имитирующих выражение лица, движения рта и моргание глаз, то эти же видео могут быть использованы и для тестирования различных методов обнаружения глубоких подделок. Имеются исследования, результаты тестов в которых показывают, что популярные системы распознавания лиц, основанные на VGG и FaceNet [26], не способны эффективно обнаруживать глубокие подделки. Другие методы, такие как подходы к синхронизации по губам [27] и показатели качества изображения с помощью метода опорных векторов (SVM) [28], приводят к очень высокой частоте ошибок при применении для обнаружения глубоких подделок видео из этого недавно созданного набора данных. Это вызывает озабоченность по поводу острой необходимости будущей разработки более надежных методов, которые могут отличать подделки от подлинных.

Источник: https://otherreferats.allbest.ru/download/1351201/