Вводящие в заблуждение творения ИИ
Зрители порой видят и слышат реальных людей, которые на экране делают или говорят то, чего никогда не происходило в реальной жизни. Потому что это — дипфейк. Термин происходит от английских слов «deep learning» — «глубинное обучение» и «fake» — «подделка». Это технология синтеза изображения или голоса на базе искусственного интеллекта (ИИ), позволяющая создавать фальсифицированные, но очень правдоподобно выглядящие фото-, видео- и аудиоматериалы.
Технология подмены
Нейросеть просматривает множество фотографий, видеороликов или аудиозаписей конкретного человека. ИИ анализирует его мимику, жесты и голос и накладывает полученный синтетический образ на реальный или полностью генерирует фальшивый контент. Известно три основных типа дипфейков: подмена лица (Face swap), когда на фото или видео лицо одного человека переносится на тело другого; синтез речи (Voice cloning), или создание аудиозаписи, текст которой произносится голосом другого человека, в т.ч. в режиме реального времени, и оживление фотографии или воссоздание лица (Face Reenactment), подразумевающее воспроизведение мимики или движений головы и губ конкретного лица, когда ИИ заставляет статичное изображение двигаться и говорить.
Актуальная проблема
Использование дипфейков в развлекательной сфере можно назвать сравнительно безобидным. Однако данную технологию все шире используют мошенники для обмана потребителей и «выкачивания» денег, а также нечистоплотные политические силы и отдельные пользователи для влияния на общественное мнение и результаты выборов и прочих манипуляций, дезинформации, распространения государственной пропаганды и даже шантажа.
«Первой ласточкой» в этом отношении стала дипфейк-порнография, или фальшивые порнографические видео, появляющиеся в интернете с 2017 года. Порно-дипфейки и ныне составляют более 90% видео, генерируемых с использованием данной технологии. С 2018 года дипфейки стали активно использоваться также в общественно-политической жизни, а с 2022 года — и в военно-политических целях.
Все чаще «персонажами» дипфейков становятся популярные ведущие и известные политики, такие как Гюнтер Яух, Маркус Ланц или Барбара Шенебергер, что плохо сказывается на репутации программ. Только недавно «фальшивая» Аня Коль, ведущая биржевых новостей на ARD, призвала пользователей вкладываться в сомнительные финансовые продукты.
Своего рода «вишенкой на торте» стали появившиеся на TikTok в конце мая многочисленные видео, в которых бундесканцлер Фридрих Мерц говорил о сокращении минимальной зарплаты «для улучшения инфраструктуры в Германии» с 1 января 2027 г. с 13 до 11 евро в час. Их посмотрели более 900 тыс. пользователей. Вскоре эксперты из Института прикладной и комплексной безопасности Frauenhofer, проанализировавшие видео, пришли к выводу, что голос бундесканцлера, по всей вероятности, был генерирован искусственным интеллектом. На официальном веб-сайте бундесканцлера и в других серьезных источниках подобная информация отсутствовала.
Наоборот, в действительности предусмотренную законодательством минимальную заработную плату (Mindestlohn) в 2027 году планируется повысить с 13,90 до 14,60 евро в час. Тем не менее, видео на TikTok не содержали никаких указаний об использовании ИИ — несмотря на то, что, по правилам платформы, «контент, генерированный искусственным интеллектом или подвергшийся существенной обработке с использованием ИИ и показывающий реалистично выглядящие сцены или людей», должен быть соответствующим образом промаркирован.
Впрочем, это не единственный дипфейк подобного рода, затрагивающий интересы миллионов людей. Специалистам уже приходилось опровергать ложные сообщения о том, что семьям разрешено будет иметь только одну машину, что после 22 часов вечера жителям Германии нельзя будет пользоваться личными автомобилями, а во всех супермаркетах должны быть организованы отделы халяльных (т.е. соответствующих нормам шариата) продуктов.
Глобальные риски
Лица и голоса, генерируемые искусственным интеллектом, являются настолько правдоподобными, что даже специалистам становится все труднее отличить их от реальных. Если раньше для создания дипфейков требовалась сложная и дорогостоящая техника, то сегодня едва ли не каждый пользователь в состоянии создавать фейки высокого уровня с помощью общедоступных ИИ-программ. Таким образом, люди оказываются в мире, в котором уже нельзя определить, сказал ли тот или иной человек определенные слова или совершил определенные действия или нет.
Дипфейки наносят вред сразу на трех уровнях: потребителям и пользователям, не способным отличить правду от лжи, генерируемой искусственным интеллектом, общественным деятелям и другим публичным личностям, не способным защититься и опасающимся за свою репутацию, и обществу в целом. С появлением каждого нового дипфейка люди теряют доверие к лицам, оказывающимся «персонажами» очередного фейкового контента, и к государственным учреждениям и веру в демократию.
Недаром Организация Объединенных Наций в настоящее время считает дезинформацию, включая дипфейки, одним из самых серьезных глобальных рисков и серьезной и непосредственной угрозой. Принятием «Глобальных принципов по обеспечению честности информации» («Global Principles for Information Integrity») ООН создала базу, в рамках которой могут действовать государства, платформы, СМИ и гражданское общество, чтобы бороться с нею.
Даже Папа Римский Лев XIV в своей первой энциклике, 100-страничной «Magnifica Humanitas», называет обращение с искусственным интеллектом решающим моментом для будущего всего человечества. Он предупреждает о многочисленных опасностях вплоть до расчеловечивания из-за неправильного использования дигитальных технологий, требует введения строгих правил и ограничений, четких критериев и широкого общественного контроля в вопросах, касающихся использования ИИ, и настаивает на том, чтобы ИИ ориентировался на человеческие ценности и человеческую мораль.
Распознавание фальшивок
Технологии создания дипфейков постоянно совершенствуются, так что распознавать их становится все сложнее. Тем не менее, специалисты советуют обращать внимание на подозрительные физические детали, ошибки в освещении и внешнее окружение. Физическими признаками являются неестественное моргание (слишком частое или редкое), отсутствие синхронизации между движениями губ и произносимыми словами, «стеклянный» или устремленный в одну точку взгляд, ненатуральные или размытые черты лица, неправильные «переходы» между волосами и лицом или лицом и шеей или несовпадение цвета и структуры кожи в местах перехода, ограниченная мимика и ненатуральные движения, осанка или положение рук.
Важно также обращать внимание на то, соответствуют ли тени на лице окружению и источнику света. Характерными особенностями синтезированного голоса являются «металлический» звук, неправильное произношение или расстановка ударений, акцент, монотонная речь, неестественные звуки на заднем плане и запаздывание с произношением слов. Кроме того, необходимо тщательно всматриваться в фон в поисках нечеткости и размытости, обтрепанных или измочаленных краев, а при «галлюцинациях» ИИ на заднем плане нередко присутствуют детали, которые не могут существовать в реальности.
Когда речь идет об аудио- и видеофайлах, специалисты советуют использовать программное обеспечения для распознавания фейков (Erkennungssoftware). Известными и общедоступными платформами для осуществления проверки являются, в частности, Deepware Scanner, DeepFake-O-Meter и Deepfake Total Fraunhofer AISEC, а предприятиям целесообразно прибегать к профессиональным инструментам типа Reality Defender или TruthScan. Помимо дигитальных инструментов верификации, рекомендуется отслеживать источники происхождения материалов, включая их интернет-адрес и выходные данные (Impressum), проверять контент по сообщениям достойных доверия СМИ или официальным новостным сайтам, оценивать контекст и логику и проявлять здоровый скептицизм.













































