Мошенничество с клонированием голоса перестало быть редким и экзотическим случаем — это уже массовое, технически отлаженное явление. По данным одного из крупных российских операторов связи, звонки с синтезированным или клонированным голосом составляют около 10% всего мошеннического трафика в сети по состоянию на апрель 2026 года, а за весь 2025 год оператор заблокировал более 865 миллионов подобных вызовов. Эти цифры показывают, что технология давно вышла за рамки единичных показательных случаев и превратилась в промышленный инструмент обмана.
Ключевая причина взрывного роста — радикальное снижение технического порога входа для мошенников. Если ещё несколько лет назад для убедительного клонирования голоса требовались десятки минут качественной записи, то современным сервисам достаточно короткого фрагмента — иногда буквально нескольких секунд аудио, взятого из социальной сети, видео на YouTube или даже более раннего звонка мошенника, который был тайно записан. Это делает мишенью практически любого человека, чей голос хоть раз попадал в открытый доступ, будь то видео с семейного праздника или голосовое сообщение в мессенджере.
Опросы подтверждают, что проблема уже коснулась значительной части населения: по данным исследования McAfee, охватившего свыше 7 тысяч человек в разных странах, около 25% респондентов заявили, что уже сталкивались с той или иной формой голосового мошенничества. Это означает, что вопрос распознавания искусственного голоса перестал быть теоретическим — статистически каждый четвёртый человек рано или поздно окажется в ситуации, где нужно принять решение за считаные секунды разговора.
Наиболее уязвимой категорией остаются пожилые люди, часто менее знакомые с современными схемами обмана и более склонные доверять узнаваемому голосу без критической проверки. Именно на эту аудиторию преимущественно ориентированы классические схемы «внук в беде» или «родственник попал в аварию», построенные на эмоциональном давлении и требовании немедленного решения.
Как устроена типичная схема обмана с клонированным голосом
Прежде чем разбирать признаки поддельного голоса, важно понимать логику самой схемы — она построена не столько на техническом совершенстве синтеза, сколько на психологическом давлении, которое мешает жертве включить критическое мышление. Классический сценарий выглядит так: человеку звонит «близкий родственник», голос которого он узнаёт, и сообщает, что находится в беде — попал в аварию, задержан полицией, оказался в опасности — и ему срочно нужны деньги.
Показателен реальный случай, зафиксированный в отчёте о подобных мошенничествах: пожилому человеку позвонил «внук», сообщивший, что попал в автокатастрофу и оказался в тюрьме, и настаивавший на срочном переводе денег. Пожилой человек проявил здравую осторожность — предложил «внуку» перезвонить его родителям — и повесил трубку. Позже выяснилось, что сосед получил идентичный по сценарию звонок, что подтвердило: это была часть масштабной скоординированной схемы, а не единичный случай.
Мошенники намеренно выстраивают разговор так, чтобы жертва не успела включить рациональную проверку услышанного. Использование срочности и эмоционального давления подталкивает людей к немедленному действию прежде, чем они успевают усомниться в подлинности того, что слышат — это ключевой психологический механизм, на котором строится подавляющее большинство подобных схем, независимо от конкретной легенды звонка.
Немые звонки как этап подготовки к мошенничеству
Отдельная, менее очевидная угроза — так называемые немые звонки, которые сами по себе не выглядят как попытка обмана, но могут быть подготовительным этапом. Специалисты отмечают, что некоторые автоматические системы способны анализировать голос жертвы или записывать короткую фразу — «да», «алло», «кто это?» — и в теории такой аудиопрофиль может быть впоследствии использован для создания голосового клона или подделки согласия на какую-либо операцию. На практике мошенники пока чаще используют подобные звонки для более простых целей — подтверждения активности номера, — но потенциальная возможность накопления голосовых образцов через немые звонки уже рассматривается экспертами как реальный риск.
Технические признаки синтетического голоса
Несмотря на стремительный прогресс технологий синтеза речи, современные модели по-прежнему оставляют распознаваемые артефакты — просто их становится всё сложнее уловить неподготовленному слуху. Специалисты по кибербезопасности выделяют несколько устойчивых технических признаков, которые стоит отслеживать при подозрительном звонке:
Нестабильность тембра на отдельных словах. В искусственно сгенерированной речи тембр голоса может слегка «плыть» на длинных или редких словах, тогда как в остальной части фразы звучит ровно и убедительно — это связано с ограничениями обучающих данных модели на редко встречающихся речевых конструкциях.
Неестественное дыхание. Живая речь человека сопровождается едва заметными паузами на вдох, которые естественно вплетаются в темп разговора. Синтетическая речь либо звучит с подозрительно ровным, «безупречным» дыханием, либо вовсе не имеет пауз на вдох — хотя более новые модели уже научились имитировать этот эффект, добавляя искусственные вдохи перед репликой.
Вставленные, «неживые» паузы. Паузы в синтетической речи часто воспринимаются как механически вставленные, а не как естественная часть разговорного ритма — они могут возникать в неожиданных местах фразы или, наоборот, отсутствовать там, где живой человек естественно сделал бы небольшую остановку для передышки или обдумывания следующей мысли.
Сниженная вариативность интонации. Голосовые ИИ-модели, даже качественные, часто звучат несколько более «плоско», чем живой человек — при внимательном прослушивании заметна меньшая тональная вариативность, чем можно ожидать от естественной эмоционально окрашенной речи, особенно в стрессовой ситуации, которую имитирует мошенническая схема.
Нетипичные ошибки произношения. Люди действительно иногда оговариваются, но AI-модель может ошибаться специфическим образом — например, неверно произносить редкое или составное слово так, как это не свойственно живой человеческой речи, а свойственно именно артефактам синтеза.
Почему технические признаки со временем становятся менее надёжными
Важно понимать ограничение этого подхода: перечисленные признаки работают тем хуже, чем современнее используемая мошенниками модель синтеза. Изначально сервисы для генерации аудио имитировали голос достаточно топорно, и сгенерированный текст было легко отличить по нелогичным паузам, неправильным интонациям и неестественно ровному темпу речи — но по мере развития технологии эти различия стираются, и если человек заранее не знает, что слышит синтетический голос, отличить его от реального собеседника становится практически невозможно на слух.
Дополнительная сложность связана с каналом передачи звука: исследователи отмечают, что при воспроизведении дипфейка через колонку или динамик телефона автоматические AI-детекторы часто не срабатывают, поскольку переозвучка через дополнительное устройство убирает ключевые акустические артефакты, по которым синтетическую речь можно распознать программными средствами. Это означает, что полагаться исключительно на технический слух — рискованная стратегия, особенно по мере совершенствования моделей синтеза.
Поведенческие сигналы, которые важнее технических деталей
Поскольку чисто акустические признаки становятся всё менее надёжными, эксперты по кибербезопасности всё чаще смещают акцент на поведенческую сторону разговора — то, как выстроен сценарий звонка, а не то, как именно звучит голос. Мошенничество с искусственным интеллектом не предполагает взлома устройств или систем безопасности: вся схема строится на манипуляции доверием через узнаваемый голос, а технология используется лишь как инструмент для создания этого доверия.
Несколько поведенческих сигналов должны настораживать независимо от того, насколько убедительно звучит голос собеседника:
Требование срочного и немедленного действия — перевода денег, передачи кода из СМС, раскрытия личных данных — без возможности перепроверить информацию или посоветоваться с другими членами семьи.
Настойчивое давление не вешать трубку и не перезванивать самостоятельно на привычный номер собеседника для проверки, а действовать строго в рамках текущего разговора.
Просьба о нестандартном способе передачи денег — через криптовалюту, малоизвестные платёжные сервисы, перевод третьему лицу — вместо привычного для этого человека способа.
Излишне драматичный, эмоционально насыщенный контекст звонка — авария, арест, похищение — специально сконструированный так, чтобы жертва действовала на эмоциях, а не рационально.
Самый надёжный практический способ защититься — не пытаться распознать синтетический голос на слух в момент звонка, а взять паузу и перезвонить собеседнику самостоятельно на заранее известный номер, либо связаться с ним через другой канал связи. Мошенничество, включая использование клонированных голосов для обмана, является уголовно наказуемым во многих странах даже несмотря на то, что сама технология синтеза речи легальна, — поэтому прерванный звонок с последующей самостоятельной перепроверкой не создаёт никакого риска, тогда как поспешное действие по указанию звонящего может стоить реальных денег.