Baidu представила улучшенный алгоритм клонирования речи

Китайский технологический гигант Baidu представил улучшенную систему синтеза речи Deep Voice. Технология быстро обучается и воспроизводит текст голосом говорящего с высокой точностью. “Аудиоклонирование” позволяет искусственно генерировать любые слова и предложения, воссоздавая при этом акцент и другие особенности речи говорящего.

В новом исследовании Baidu представила усовершенствованную технологию распознавания речи Deep Voice. В блоге компания рассказала, что на обучение алгоритма уходит не более получаса. За это время система изучает образцы голоса говорящего и учится их имитировать. Один алгоритм способен воспроизводить тысячи голосов. Однако чем больше образцов изучает система, тем качественнее становится имитация.

Математик доказал, что черные дыры могут стирать прошлое

На сайте GitHub можно прослушать аудиофайлы с демонстрацией возможностей Deep Voice. Для сравнения компания опубликовала примеры клонированной речи, воссозданной на примере 5, 10, 20, 50 и 100 образцов. После 5 и 10 образцов алгоритм воспроизводит речь не слишком отчетливо. По мере обучения синтезированная речь становится все более правдоподобной. Но, как отмечает The Register, пока имитацию можно отличить от оригинала по низкому качеству звука и шумам.

Компания представила технологию Deep Voice в марте прошлого года. В мае алгоритм Deep Voice 2 уже научился имитировать акценты и синтезировать речь всего за полчаса. Тогда система могла работать с сотнями образцов. Улучшенная модель способна обрабатывать тысячи голосов. При этом синтезировать голос алгоритм может даже после прослушивания коротких фраз длиной в несколько секунд.

При клонировании голоса Baidu использует две техники — метод адаптации и метод расшифровки. В первом случае система изучает голоса нескольких говорящих. В экспериментах компания использовала набор данных LibriSpeech, в котором собраны образцы речи 2484 человек. Алгоритм выделяет отдельные компоненты в произнесенных фразах и имитирует голос с учетом особенностей произношения и ритма. При методе расшифровки система исследует речь каждого говорящего в отдельности, а сам процесс занимает всего несколько секунд.

10 прорывных технологий 2018 года

Один из авторов исследования Серкан Арик рассказал The Register, что метод расшифровки проще применить в реальной жизни. Он не требует большого объема памяти и подходит для использования на смартфонах и умных колонках. Пока система далека от совершенства, но в будущем она позволит создавать голосовых помощников, которые будут говорить голосом пользователя. Причем на процесс обучения уйдет несколько минут.

По словам Арика, о рисках технологии пока говорить рано — алгоритм еще не умеет синтезировать речь со 100%-ной точностью. Однако в будущем Baidu планирует защитить систему от использования в преступных целях.

Генеративные сети и базовые алгоритмы на основе машинного обучения уже умеют генерировать фотографии, изображения и видеоролики, которых никогда не существовало в действительности. Так, алгоритм Nvidia научился создавать убедительные фальшивые видео, на которых день преобразуется в ночь, а зимний пейзаж — в летний. При этом отличить синтезированный контент от настоящего практически невозможно.

Открыты материалы, которые совершат революцию в электронике

Некоторые эксперты уже говорят о наступлении информационного апокалипсиса, первыми признаками которого стали фальшивые новости в социальных сетях. Со временем у людей может выработаться апатия по отношению к реальности и полная неспособность отличить правду от вымысла.

Подписывайтесь
на наши каналы в Telegram

«Хайтек»новостионлайн

«Хайтек»Dailyновости 3 раза в день

Первая полоса
Россияне жалуются на сбои в работе eSIM и SIM-карт в iPhone: что происходит
Новости
Ученые обнаружили новый тип планет: как они устроены
Новости
Названа самая частая причина «развода» пингвинов
Новости
Эта частица станет ключом к разгадке темной материи во Вселенной  
Новости
Названы последствия саботажа трубопровода «Северный поток» в Балтике
Новости
Ученые придумали, как создать более емкие и долговечные аккумуляторы
Новости
Анализ подтверждает гипотезу, что Луна «откололась» от Земли
Космос
Инженеры «связали» прочную кольчугу толщиной в несколько атомов
Наука
«Хаббл» за 10 лет создал крупнейшую панораму соседней галактики
Космос
В ОАЭ построят крупнейшую круглосуточную солнечную электростанцию
Новости
Астрофизики рассмотрели детали активного ядра галактики
Космос
Камера, которая имитирует глаз насекомого, снимает в полумраке 9120 кадров в секунду
Новости
Найдена огромная черная дыра, которая стреляет энергией в сторону Земли
Новости
Выяснилось, когда и откуда во Вселенной появилась вода на самом деле
Новости
Инженеры придумали, как управлять приложениями с помощью ног
Новости
Найден странный источник радиосигналов, которого «не может быть»
Космос
Что будет, если ежедневно пить один бокал пива или вина — исследование
Наука
Посмотрите на взрыв корабля Starship в небе: в чем причина аварии
Космос
ИИ в e-commerce: как он работает и как его правильно использовать
Мнения
Китайский робопес установил рекорд скорости в стометровом забеге
Новости