Статья: Применение глубокого обучения для создания и обнаружения поддельных изображений, синтезированных с помощью искусственного интеллекта

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

Рассмотрим методы обнаружения глубоких подделок, группируя их в две основные категории: методы обнаружения поддельных изображений и методы обнаружения поддельного видео (см. рис. 3). Последние можно разделить на две более мелкие группы: визуальные артефакты в рамках методов, основанных на анализе одного видеокадра, и особенности времени в рамках методов, основанных на анализе нескольких кадров. В то время как большинство методов, основанных на временных характеристиках, используют рекуррентные модели классификации глубокого обучения, методы, использующие визуальные артефакты в видеокадре, могут быть реализованы либо глубокими, либо мелкими классификаторами.

Рис. 3. Классификация методов обнаружения глубоких подделок

Fig. 3. Classification of deep fake detection methods

Обнаружение поддельных изображений

Замена лиц из коллекции стандартных изображений при подделке изображений и видео популярна не только для подделки личности, как таковой, но и как метод кибератаки, с помощью которой возможно проникновение в системы идентификации или аутентификации с целью получения незаконного доступа. Использование глубокого обучения, такого как CNN и GAN, сделало обмен изображениями лиц более сложным для моделей судебной экспертизы, поскольку оно может сохранять позу, выражение лица и освещение фотографий [29]. Кроме того, для разделения поддельных изображений лиц и подлинных используется метод «мультимножества слов» [30], который применяется для извлечения набора компактных объектов и передачи его в различные классификаторы, такие как SVM [31], случайный лес (Random Forest, RF) [32] и многослойные персептроны (MLP) [33]. Среди изображений, созданных с помощью глубокого обучения, подделку наиболее трудно обнаружить в тех, которые синтезированы с помощью моделей GAN, поскольку они реалистичны и качественны из-за способности модели GAN изучать распределение сложных входных данных и генерировать новые выходные данные с аналогичным распределением входных данных.

Однако в большинстве методов по обнаружению изображений, сгенерированных GAN, не учитывается возможность обобщения моделей обнаружения (как одного из этапов работы нейросети), хотя разработка GAN продолжается, и часто вводятся многие новые расширения этой модели. Например, можно использовать этап предварительной обработки изображения, например, размытие по Гауссу и нормально распределенный шум, для удаления низкоуровневых высокочастотных подсказок изображений GAN [34]. Это увеличивает статистическое сходство на уровне пикселей между реальными изображениями и поддельными изображениями и требует, чтобы криминалистический классификатор изучал больше внутренних и значимых функций, которые обладают лучшей способностью к обобщению, чем предыдущие методы криминалистики изображений [35], или сети стегано-анализа изображений [36].

Обнаружение поддельного видео

Все методы обнаружения видео с глубокой подделкой классифицируются на две группы: методы, использующие временные функции, и методы, исследующие визуальные артефакты в кадрах. Большинство ранее рассмотренных методов обнаружения поддельных изображений не могут быть использованы для видео из-за сильного ухудшения данных кадра после сжатия видео и варьирования временных характеристик набора кадров [37].

В методах, использующих временные особенности между видеокадрами, рассматривается наличие покадровых артефактов низкого уровня, появляющихся при манипуляциях с лицом. В качестве примеров можно назвать рекуррентную сверточную модель (RCN), основанную на интеграции сверточной сети DenseNet [38] и закрытых рекуррентных элементарных ячеек [39] для использования временных расхождений между кадрами (см. рис. 4). Предлагаемый метод протестирован на наборе данных FaceForensics++, который включает 1000 видео [40], и показывает многообещающие результаты.

Рис. 4. Двухэтапный процесс обнаружения манипуляций с лицами, в котором этап предварительной обработки направлен на обнаружение, обрезку и выравнивание лиц в последовательности кадров, а второй этап различает обработанные и подлинные изображения лиц путем объединения сверточной нейронной сети (CNN) и рекуррентной нейронной сети (RNN) (см. рис. 3 из [17])

Fig. 4. Two-step face manipulation detection process where the pretreatment is aimed at detecting, trimming and aligning faces in a sequence of frames, and the second stage distinguishes between processed and genuine facial images by combining convolutional neural network (CNN) and recurring neural network (RNN) (see Fig. 3 from [17])

Deepfake-видео содержат внутрикадровые несоответствия и временные несоответствия между кадрами, которые можно выявить с помощью метода конвейера с учетом времени, который использует CNN и долговременная кратковременная память (LSTM) для обнаружения видео с глубокой подделкой [41]. CNN используется для извлечения функций уровня кадра, которые затем передаются в LSTM для создания дескриптора временной последовательности. Полностью подключенная сеть используется для отделения подделанных видео от реальных на основе дескриптора последовательности, как показано на рисунке 5.

Сеть обнаружения, состоящая из полностью соединенных слоев, используется для приема дескриптора последовательности в качестве входных данных и вычисления вероятностей последовательности кадров, принадлежащих либо к аутентичному, либо к классу глубокой подделки [41].

Для выявления подделок используются временные характеристики некоторых физиологических параметров. Например, частоту моргания глаз - не имея доступа к изображениям моргающих людей, алгоритмы глубокой подделки не имеют возможности генерировать поддельные лица, которые могут нормально мигать. Частота мигания в deepfakes намного ниже, чем в обычных видео, или моргание в принципе отсутствует.

Рис. 5. Метод обнаружения глубокой подделки с использованием сверточной нейронной сети (CNN) и долговременной кратковременной памяти (LSTM) для извлечения временных характеристик данной видеопоследовательности, которые представлены с помощью дескриптора последовательности (см. рис. 4 из [17])

Fig. 5. Method of deep fake detection using convolutional neural network (CNN) and long-term short-term memory (LSTM) to extract time characteristics of a given video sequence, which are represented by a sequence descriptor (see Fig. 4 from [17])

Другой подход, который обычно используется для выявления поддельных видео - это разделение видео на кадры и последующее исследование их на наличие визуальных артефактов в пределах отдельных кадров для получения дискриминантных признаков, которые далее распределяются с помощью глубокого или поверхностного классификатора. Таким образом, методы этого подхода группируются на основе следующих типов классификаторов:

а) Глубокие классификаторы: видео deepfake обычно создаются с ограниченным разрешением, для которых требуется аффинный подход к искажению лица (то есть масштабирование, поворот и сдвиг), чтобы соответствовать конфигурации исходных. Из-за несоответствия разрешения между искривленной областью лица и окружающим контекстом этот процесс оставляет артефакты, которые могут быть обнаружены моделями CNN.

Для устранения ограничений CNN при применении к обратным графическим задачам, которые направлены на поиск физических процессов, используемых для создания изображений, можно использовать капсульные сети [42]. Для описания иерархических отношений между частями объекта капсульную сеть можно модернизировать алгоритмом динамической маршрутизации [43] как компонентом конвейера для обнаружения сфабрикованных изображений и видео (см. рис. 6). Алгоритм динамической маршрутизации развертывается для маршрутизации выходов трех капсул к выходным капсулам через ряд итераций для разделения между поддельными и реальными изображениями. Метод оценивается с помощью четырех наборов данных, охватывающих широкий спектр поддельных атак на изображения и видео. Они включают в себя хорошо известные наборы данных для повторной атаки - набора данных для замены лиц deepfake, FaceForensics и других. Предлагаемый метод обеспечивает наилучшую производительность по сравнению с конкурирующими методами во всех этих наборах данных. Это показывает потенциал капсульных сетей в создании общей системы обнаружения deepfake, которые могут эффективно работать при различных поддельных атаках на изображения и видео.

б) Неглубокие классификаторы используют метод обнаружения, наблюдая различия между трехмерными положениями головы, включающими ориентацию и ее положение, которые оцениваются на основе 68 лицевых ориентиров центральной области лица. Извлеченные объекты подаются в классификатор SVM для получения результатов обнаружения. Эксперименты с двумя наборами данных показывают высокую эффективность предлагаемого подхода по сравнению с его конкурирующими методами.

Рис. 6. Использование капсульной сети признаков для выявления поддельных изображений или видео. На этап предварительной обработки выделяется область лица и масштабируется до размера 128x128, а затем извлекаются скрытые признаки для капсульной сети (три основных капсулы и две выходные капсулы - одной для реальных и одной для поддельных изображений). Статистический пул составляет важную часть капсульной сети, которая занимается обнаружением подделок (см. рис. 5 из [17])

Fig. 6. Use of a capsule network of features to detect counterfeit images or videos. The pre-processing step detects face region and scales it to the size of 128x128 and then extracts latent features for the capsule network (three primary capsules and two output capsules, one for real and one for fake images). The statistical pooling is an important part of the capsule network that deals with forgery detection (see Fig. 5 from [17])

При появлении подозрений в подделке видео или изображения пользователи обычно хотят найти его источник, что является затруднительным в настоящее время ввиду отсутствия практического инструмента. Исследователи предлагают использовать технологии блокчейна или смарт-контрактов для помощи пользователям в обнаружении видео с глубокой подделкой, основываясь на предположении, что видео являются реальными только тогда, когда их источники отслеживаются [44]. Каждое видео связано со смарт-контрактом, который ссылается на его родительское видео, и каждое родительское видео имеет ссылку на его дочернее в иерархической структуре. Благодаря этой цепочке пользователи могут достоверно отследить исходный смарт-контракт, связанный с первичным видео, даже если видео было скопировано несколько раз. Важным атрибутом смарт-контракта являются уникальные хэши распределенной файловой системы, которая используется для хранения видео и его метаданных децентрализованным и адресуемым к контенту способом [45]. В целях обеспечения соответствия решения требованиям безопасности ключевые функции и функциональные возможности смарт- контракта проверяются на таких распространенных проблемах безопасности, как распределенный отказ в обслуживании, воспроизведение и атаки «человек в середине» [46]. Этот подход является общим и может быть распространен на другие типы цифрового контента, например, изображения, аудио и рукописи.

Заключение

Широкое внедрение средств искусственного интеллекта позволило повысить качество глубоких подделок и увеличить производительность применяемых методов. Методы обнаружения подделок еще не так развиты и находятся еще на ранней стадии становления, но уже также активно используют искусственный интеллект, обрабатывающий фрагментированные наборы данных Подход к повышению производительности методов обнаружения заключается в создании постоянно обновляемого эталонного набора данных глубоких подделок, что облегчает процесс обучения моделей.

Кроме того, современные методы обнаружения в основном сосредоточены на недостатках конвейеров генерации deepfake, то есть на поиске слабых мест конкурентов для их атаки. Такого рода информация и знания не всегда доступны в конкурентной среде, где злоумышленники обычно пытаются не раскрывать такие технологии создания глубоких подделок. Это реальные проблемы разработки методов обнаружения, и будущие исследования должны быть сосредоточены на внедрении более надежных, масштабируемых и обобщаемых методов.

Другим направлением исследований является интеграция методов обнаружения подделок в платформы распределенного доступа (типа социальных сетей) для повышения их эффективности в борьбе с широким распространением подделок. Механизм скрининга или фильтрации с использованием эффективных методов обнаружения подделок может быть реализован на этих платформах для облегчения обнаружения deepfake [47]. Для технологических компаний, владеющих этими платформами, могут быть установлены юридические требования по быстрому удалению глубоких подделок в целях уменьшения их вредного воздействия. Кроме того, инструменты водяных знаков также могут быть интегрированы в устройства, которые люди используют для формирования цифрового контента, чтобы создавать неизменяемые метаданные для хранения деталей оригинальности, таких как время и местоположение мультимедийного контента, а также их беспрепятственной аттестации. Эту интеграцию сложно реализовать, но решением для этого может стать использование технологии блокчейн, которая в настоящее время уже эффективно используется во многих областях. Создание цепочек уникальных неизменяемых блоков метаданных является отличным инструментом для решения проблемы цифрового происхождения.

Примечания

программный deepfake глубокое обучение алгоритм

1. Protecting world leaders against deep fakes / S. Agarwal, H. Farid, Y. Gu, M. He, K. Nagano, H. Li // IEEE Conference on Computer Vision and Pattern Recognition // Workshop on Media Forensics. 2019. P. 38-45.

2. Lin J., Li Y., Yang G. FPGAN: Face deidentification method with generative adversarial networks for social robots // Neural Networks. 2021. No. 133. P. 132-147.

3. Lyu S. Detecting “deepfake” videos in the blink of an eye // The conversation. Academic Rigour, Journalistic Flair. URL: https://theconversation.com/detecting-deepfake-videos-in-the-blink-of-an-eye-101072 (дата обращения: 01.10.2021).

4. How faking videos became easy - and why that's so scary // Bloomberg. URL: https://fortune.com/2018/09/11/deep-fakes-obama-video/ (дата обращения: 01.10.2021).

5. Xinyi Zhou, Reza Zafarani. A Survey of Fake News: Fundamental Theories, Detection Methods and Opportunities // ACM Computing Surveys. 2020. Vol. 53, Iss. 5. P. 1-40. DOI: 10.1145/3395046

6. The Newest AI-Enabled Weapon: `Deep-Faking' Photos of the Earth. Patrick Tucker // Defence One. URL: https://www.defenseone.com/technology/2019/03/next-phaseai-deep-faking-whole-world-and-china- ahead/155944/ (дата обращения: 01.10.2021).

Источник: https://otherreferats.allbest.ru/download/1351201/