ИИ от OpenAI научился говорить с эмоциями и понимать акценты

OpenAI объявила о выпуске улучшенных моделей искусственного интеллекта (ИИ) для преобразования текста в речь и речи в текст.

Компания представила модель gpt-4o-mini-tts для синтеза речи из текста, которая, по заявлениям разработчиков, обеспечивает более естественное и реалистичное звучание по сравнению с предыдущими версиями. В модели можно тонко настраивать характеристики голоса, включая интонации, паузы и эмоциональную окраску. Разработчики могут давать простые инструкции, например, «говори как сумасшедший ученый» или «используй спокойный голос, как ментор».

По словам Джеффа Харриса, сотрудника отдела разработки продуктов OpenAI, компания стремилась предоставить контроль не только над содержанием, но и над способом передачи информации. «В реальных задачах вам не нужен просто плоский, монотонный голос. Если вы работаете в службе поддержки клиентов и хотите, чтобы голос извинялся, потому что он совершил ошибку, вы можете заставить ИИ передавать эту эмоцию», – пояснил Харрис.

Новая модель поддерживает русский язык, хотя при озвучивании текста иногда заметен небольшой акцент. Пользователи могут бесплатно протестировать технологию на сайте.

В веб-интерфейсе можно настраивать разные параметры голоса

Кроме того, OpenAI представила две модели для преобразования речи в текст: gpt-4o-transcribe и gpt-4o-mini-transcribe, которые призваны заменить существующую модель Whisper. Обученные на разнообразных аудиоданных, эти модели распознают речь с акцентом даже в условиях шума. Харрис говорит, что новые модели значительно реже «галлюцинируют», то есть меньше склонны фальсифицировать слова или целые отрывки в стенограммах.

Внутреннее тестирование показало, что точность транскрипции варьируется в зависимости от языка. Так, для индийских и дравидийских языков коэффициент ошибок может достигать 30%, что означает, что три из десяти слов могут отличаться от человеческой транскрипции. В популярных языках — английском, испанском, португальском — доля ошибок не превышает 5–10%.

Данные о доле ошибок для распознавания текстов на разных языках. Источник: OpenAI

Все представленные новинки уже доступны через API OpenAI, что позволяет разработчикам интегрировать передовые голосовые технологии в свои приложения и сервисы.


Читать далее:

Вселенная внутри черной дыры: наблюдения «Уэбба» подтверждают странную гипотезу

Загадочное явление в центре Млечного Пути может скрывать новый вид темной материи

Посмотрите на Антарктиду без льда: опубликована подробная карта южного континента

На обложке: designed by Freepik, сведения о лицензии

Подписывайтесь
на наши каналы в Telegram

«Хайтек»новостионлайн

«Хайтек»Dailyновости 3 раза в день

Первая полоса
Китайский аккумулятор для электромобиля выдержал наезд 36-тонного танка
Новости
Воспитанники детских домов изучат основы работы с нейросетями
Новости
Четвероногий робот из Цюриха научился играть в бадминтон с людьми
Новости
В MIT раскрыли механизм набора веса из-за жирной пищи и как обратить его вспять
Наука
60 000 лет рядом: ученые выяснили, кто стал первым паразитом человека
Наука
Ректора Университета Иннополис избрали членом-корреспондентом РАН
Иннополис
В Корее робопса научили паркуру и бегу по стенам: посмотрите, что он может
Новости
Древний череп «человека-муравья» нашли в Аргентине
Наука
На селфи марсохода попал неожиданный объект: его заметили не сразу
Космос
Посмотрите на двух морских коньков, которых застукали за «поцелуем» в океане
Наука
Почти 10 000 роутеров Asus тайно заразили: как проверить свой и защититься
Новости
Ракета будет доставлять товары с AliExpress за час по всему миру: ее испытали в Китае
Новости
В России пригрозили «душить» иностранные сервисы: кто в опасности
Новости
Boston Dynamics усовершенствовала систему восприятия гуманоидного робота Atlas
Новости
Наклейка на лоб анализирует мозговые волны и предсказывает переутомление
Наука
Посмотрите на робота-трансформера, который меняет форму прямо в полете
Новости
Китай отправил миссию за образцами горных пород с квазиспутника Земли
Космос
ИИ научился предсказывать успеваемость студентов по данным профиля в VK
Новости
Странная звезда Млечного Пути пульсирует каждые 44 минуты и это не объяснить
Космос
Этот OLED-экран сам издает звук: каждый пиксель работает как динамик
Новости