ИИ от OpenAI научился говорить с эмоциями и понимать акценты

OpenAI объявила о выпуске улучшенных моделей искусственного интеллекта (ИИ) для преобразования текста в речь и речи в текст.

Компания представила модель gpt-4o-mini-tts для синтеза речи из текста, которая, по заявлениям разработчиков, обеспечивает более естественное и реалистичное звучание по сравнению с предыдущими версиями. В модели можно тонко настраивать характеристики голоса, включая интонации, паузы и эмоциональную окраску. Разработчики могут давать простые инструкции, например, «говори как сумасшедший ученый» или «используй спокойный голос, как ментор».

По словам Джеффа Харриса, сотрудника отдела разработки продуктов OpenAI, компания стремилась предоставить контроль не только над содержанием, но и над способом передачи информации. «В реальных задачах вам не нужен просто плоский, монотонный голос. Если вы работаете в службе поддержки клиентов и хотите, чтобы голос извинялся, потому что он совершил ошибку, вы можете заставить ИИ передавать эту эмоцию», – пояснил Харрис.

Новая модель поддерживает русский язык, хотя при озвучивании текста иногда заметен небольшой акцент. Пользователи могут бесплатно протестировать технологию на сайте.

В веб-интерфейсе можно настраивать разные параметры голоса

Кроме того, OpenAI представила две модели для преобразования речи в текст: gpt-4o-transcribe и gpt-4o-mini-transcribe, которые призваны заменить существующую модель Whisper. Обученные на разнообразных аудиоданных, эти модели распознают речь с акцентом даже в условиях шума. Харрис говорит, что новые модели значительно реже «галлюцинируют», то есть меньше склонны фальсифицировать слова или целые отрывки в стенограммах.

Внутреннее тестирование показало, что точность транскрипции варьируется в зависимости от языка. Так, для индийских и дравидийских языков коэффициент ошибок может достигать 30%, что означает, что три из десяти слов могут отличаться от человеческой транскрипции. В популярных языках — английском, испанском, португальском — доля ошибок не превышает 5–10%.

Данные о доле ошибок для распознавания текстов на разных языках. Источник: OpenAI

Все представленные новинки уже доступны через API OpenAI, что позволяет разработчикам интегрировать передовые голосовые технологии в свои приложения и сервисы.


Читать далее:

Вселенная внутри черной дыры: наблюдения «Уэбба» подтверждают странную гипотезу

Загадочное явление в центре Млечного Пути может скрывать новый вид темной материи

Посмотрите на Антарктиду без льда: опубликована подробная карта южного континента

На обложке: designed by Freepik, сведения о лицензии

Подписывайтесь
на наши каналы в Telegram

«Хайтек»новостионлайн

«Хайтек»Dailyновости 3 раза в день

Первая полоса
Названы опасные последствия частого общения с ChatGPT: что показали исследования
Новости
Парализованный пациент смог управлять роборукой силой мысли
Наука
Илон Маск эстренно собрал сотрудников Tesla, чтобы спасти компанию: какой у него план
Новости
Российские ученые улучшили 5G и спутниковую связь: это снизит потери сигнала  
Новости
Алгоритм JAGUAR от российских математиков ускорит настройку ИИ-моделей  
Новости
«Гонец 2.0» обеспечит спутниковую связь для беспилотников по всей России  
Новости
Прыжок как у белки: инженеры научили робота балансировать на ветках
Новости
Наночастицы серебра повысили эффективность нейтронов в борьбе с раком
Наука
Миллионы «невидимых» людей: ученые нашли ошибку в оценке населения Земли
Наука
Физики открыли «невозможное»: найден новый вид оптических сингулярностей
Наука
Рекламный фрод: новые схемы обмана и технологии защиты
Мнения
Что скрывают пирамиды Гизы: под ними нашли скрытые сооружения и останки людей
Наука
Эйнштейн ошибался: темная энергия оказалась не такой, как считали ученые
Космос
ФСИН тестирует системы интеллектуальной блокировки мобильной связи в СИЗО  
Новости
Невидимые наушники: ученые показали технологию аудиоанклавов на базе ультразвука
Новости
ИИ будет следить за безопасностью во дворах российских регионов
Новости
Яндекс выпустил нейросеть, способную конкурировать с Midjourney
Новости
3D-карта Вселенной ставит под сомнение стандартную модель космологии
Космос
Робот Atlas научился танцевать брейк-данс с помощью технологии захвата движений
Новости
Химики МГУ в два раза улучшили стабильность работы электронного носа
Наука