ИИ от OpenAI научился говорить с эмоциями и понимать акценты

OpenAI объявила о выпуске улучшенных моделей искусственного интеллекта (ИИ) для преобразования текста в речь и речи в текст.

Компания представила модель gpt-4o-mini-tts для синтеза речи из текста, которая, по заявлениям разработчиков, обеспечивает более естественное и реалистичное звучание по сравнению с предыдущими версиями. В модели можно тонко настраивать характеристики голоса, включая интонации, паузы и эмоциональную окраску. Разработчики могут давать простые инструкции, например, «говори как сумасшедший ученый» или «используй спокойный голос, как ментор».

По словам Джеффа Харриса, сотрудника отдела разработки продуктов OpenAI, компания стремилась предоставить контроль не только над содержанием, но и над способом передачи информации. «В реальных задачах вам не нужен просто плоский, монотонный голос. Если вы работаете в службе поддержки клиентов и хотите, чтобы голос извинялся, потому что он совершил ошибку, вы можете заставить ИИ передавать эту эмоцию», – пояснил Харрис.

Новая модель поддерживает русский язык, хотя при озвучивании текста иногда заметен небольшой акцент. Пользователи могут бесплатно протестировать технологию на сайте.

В веб-интерфейсе можно настраивать разные параметры голоса

Кроме того, OpenAI представила две модели для преобразования речи в текст: gpt-4o-transcribe и gpt-4o-mini-transcribe, которые призваны заменить существующую модель Whisper. Обученные на разнообразных аудиоданных, эти модели распознают речь с акцентом даже в условиях шума. Харрис говорит, что новые модели значительно реже «галлюцинируют», то есть меньше склонны фальсифицировать слова или целые отрывки в стенограммах.

Внутреннее тестирование показало, что точность транскрипции варьируется в зависимости от языка. Так, для индийских и дравидийских языков коэффициент ошибок может достигать 30%, что означает, что три из десяти слов могут отличаться от человеческой транскрипции. В популярных языках — английском, испанском, португальском — доля ошибок не превышает 5–10%.

Данные о доле ошибок для распознавания текстов на разных языках. Источник: OpenAI

Все представленные новинки уже доступны через API OpenAI, что позволяет разработчикам интегрировать передовые голосовые технологии в свои приложения и сервисы.


Читать далее:

Вселенная внутри черной дыры: наблюдения «Уэбба» подтверждают странную гипотезу

Загадочное явление в центре Млечного Пути может скрывать новый вид темной материи

Посмотрите на Антарктиду без льда: опубликована подробная карта южного континента

На обложке: designed by Freepik, сведения о лицензии

Подписывайтесь
на наши каналы в Telegram

«Хайтек»новостионлайн

«Хайтек»Dailyновости 3 раза в день

Первая полоса
Найден способ сверхскоростной передачи тепла для быстрого охлаждения электроники
Наука
Условия жизни лошадей в Средневековом Новгороде восстановили по зубам
Наука
Под видом модов для Minecraft и других игр в Telegram распространяют вирусы
Новости
ИИ от создателей TikTok потеснил GPT-4o в рейтинге генераторов изображений
Новости
В России нашли минерал, который поможет изучить ядро Земли и космические тела
Космос
Анализ метеорита поставил под сомнение гипотезу о происхождении воды на Земле
Космос
«Яндекс» научил поиск решать задачи по алгебре для старшеклассников
Новости
Найдена недостающая часть Вселенной: где она скрывалась
Космос
VR в строительстве: как избежать ошибок на сотни миллионов
Мнения
44 планеты, похожие на Землю, нашли в Млечном Пути
Космос
Тайну космоса, которой больше 60 лет, наконец-то раскрыли
Космос
В «дубайском» шоколаде нашли опасные для жизни вещества
Наука
Хакеры атаковали пять оборонных предприятий России
Новости
Как ИИ повышает эффективность и снижает риски обогатительных предприятий
Мнения
«Джеймс Уэбб» изучил загадочные кольца погибшей звезды
Космос
Открыт прием заявок на ежегодную премию Digital Leaders 2025
Новости
GigaChat научился искать информацию в сети: Сбер обновил ИИ-помощника
Новости
Созданы очки с искусственным интеллектом для незрячих людей
Новости
Минобрнауки продолжит программу кешбэка для инвесторов университетских стартапов
Новости
OpenAI представила GPT-4.1: модель с улучшенными возможностями для программистов
Новости