Обратное направление к распознаванию: написанное превращается в звучащий голос. Сюда входят дикторская озвучка роликов и курсов, аудиоверсии статей, голоса ботов и автоинформаторов в телефонии, а также клонирование конкретного голоса по образцу. Главный водораздел для русскоязычных задач — не тембр, а работа с языком: ударения в омографах, аббревиатуры, числа и имена собственные читаются моделями по-разному, и именно на этом чаще всего спотыкается синтез, звучащий в остальном естественно. В каталоге — 110 нейросетей. Есть 8 с бесплатным тарифом.
NeuroFolder ведёт каталог нейросетей с 2023 года. Позиции учитывают оценку каталога, отзывы пользователей и популярность сервиса. Список регулярно обновляется.
Многие сервисы понимают знак ударения в тексте, разметку SSML или пользовательский словарь. Если ничего этого нет, слово переписывают так, как оно звучит.
Без согласия владельца голоса — нет, и серьёзные сервисы требуют подтверждения прав перед обучением. Свой голос клонировать можно, но стоит проверить условия хранения слепка.
Не всегда: телефонии нужны потоковая отдача, устойчивость к обрывам и работа с узкой полосой звука. Такие решения обычно выделены в отдельные тарифы.
На коротких репликах разница почти незаметна. На длинных текстах выдают ровная интонация, отсутствие дыхания и ошибки в редких словах — их правят разметкой.