Алгоритм распознавания речи от Microsoft сравнялся с человеком

Исследователи ИИ-подразделения Microsoft объявили, что созданная ими система распознавания речи практически сравнялась с человеком. Вероятность ошибки в кодовом слове (WER) составила 5,9% - столько же, сколько у профессиональных транскрибаторов.

Добиться таких показателей ученым помогли глубокие нейронные сети, способные хранить значительные объемы информации, — так называемые наборы обучающих данных. С их помощью система научилась распознавать паттерны в речи человека. Исследователи применили нейронные языковые модели для формирования ассоциативных облаков слов.

Система научилась понимать, что слово fast по смыслу ближе к quick, но никак не к slow. Благодаря этому алгоритм лучше ориентируется в речи и лучше понимает контекст. В процессе разработки был использован набор инструментов глубокого обучения Computational Network Toolkit от Microsoft.

«Вы не поверите, насколько дешево сделать электромобиль»

Напомним, в сентябре разработчики Microsoft достигли самого высокого в мире уровня распознавания речи на тот период — процент ошибок алгоритма составил всего 6,3%. На этот раз компания побила собственный рекорд на 0,4%. Такой процент ошибок считается самым низким в индустрии. Показатель WER у профессиональных транскрибаторов так же составляет 5,9%, отмечает Microsoft в тексте исследования.

Главный эксперт компании по изучению речи Сюэдун Хуанг заявил, что равенство ИИ и человека в этой сфере следует считать историческим достижением. Однако авторы исследования подчеркивают, что алгоритм, как и человек, пока далек от совершенства. Исследователи будут испытывать систему в шумной среде — на улицах, в ресторанах и на открытых площадках в ветреную погоду. Следующим поворотным моментом должно стать не только распознавание речи, но и ее понимание, считают в компании.

Установленный рекорд позволит усовершенствовать системы распознавания речи в Xbox, Cortana и других продуктах Microsoft.

Купить реактивный ранец можно будет уже в 2017 году

Алгоритмы учатся не только понимать речь, но и синтезировать ее. Так нейросеть WaveNet от DeepMind говорит по-английски и по-китайски более естественно, чем новейшие системы TTS Google. Хотя пока что спутать робота с человеком нельзя, система все равно превосходит большинство существующих аналогов.

Подписывайтесь
на наши каналы в Telegram

«Хайтек»новостионлайн

«Хайтек»Dailyновости 3 раза в день

Первая полоса
Тайны древней звезды по соседству изучили, «подслушав ее песню»
Космос
Baidu делает ИИ для перевода звуков животных в человеческую речь
Наука
Оказалось, ИИ врет чаще при одном условии: как этого избежать
Новости
Суперкомпьютер Маска сжирает электричество как 300 000 домов: люди протестуют
Новости
Посмотрите, как робот стремительно отбивает подачи в настольном теннисе
Новости
Физики исполнили мечту алхимиков: свинец в коллайдере превратили в золото
Наука
Создано музыкальное приложение для реабилитации после инсульта
Наука
«Эффект аккордеона» превращает жесткий графен в эластичный материал
Наука
ИИ восстановил имя автора свитка, который пережил последний день Помпеи
Наука
Частный лунный модуль вышел на орбиту спутника после двух месяцев полета
Космос
Предок тираннозавра «иммигрировал» в Америку из Азии, считают ученые
Наука
Обновленный Gemini 2.5 Pro от Google возглавил рейтинг ИИ для разработчиков
Новости
Ученые решили проблему, которая мешала запуску термоядерных реакторов почти 70 лет
Наука
Китайское «супероружие» для подводных диверсий оказалось не таким, как считалось
Новости
Отключение мобильного интернета в Москве: какие последствия для бизнеса
Новости
Киберполиция назвала новые схемы мошенников: как они воруют аккаунты на «Госуслугах»
Новости
Хокинг предсказал гибель Земли: оказалось, НАСА сочло угрозу реальной
Наука
Создатель Ethereum признал свои ошибки и решил изменить криптовалюту
Новости
«Ред ОС 8» заработала на Arm-платформах — теперь и на «Байкале»
Новости
Компания Цукерберга использовала уязвимость подростков для рекламы
Новости