Раздел про всё, что нейросети делают со звуком: синтезируют речь по тексту и клонируют голос, пишут музыку и отдельные партии, чистят записи от шума, гула и эха. Сюда же попадают голосовые роботы обзвона и озвучка видео — задачи, где результатом становится аудиодорожка. Одни сервисы узкоспециализированы и делают только синтез или только мастеринг, другие ведут всю цепочку от текста до сведённого трека. В каталоге — 320 нейросетей. Есть 22 с бесплатным тарифом.


Нейросеть для анализа музыкальных треков и создания рекомендаций.


Нейросеть для преобразования речи в текст, поддерживает множество языков.

WhisperUI Speech Text от OpenAI эффективно и с высокой точностью расшифровывает аудиофайлы на нескольких языках.


революционный инструмент, который позволяет пользователям за считанные секунды создавать подкасты студийного качества на основе технологии ии.


Нейросеть для написания текстов песен и музыкального контента.

инструмент визуализации музыки с искусственным интеллектом, который создает уникальные визуальные эффекты для музыкальных клипов и живых выступлений с использованием аудиоанализа и методов машинного обучения.

инструмент на базе ии, который очищает голоса, удаляет фоновый шум и улучшает качество звука для создателей контента за счет коррекции высоты тона, настройки голоса и удаления шума, сохраняя при этом постоянную громкость за счет сжатия динамического диапазона.


бесплатный речевой тренер с искусственным интеллектом, который предлагает персонализированную обратную связь и анализ публичных выступлений, помогая пользователям улучшить темп, подачу и общие навыки говорения.
NeuroFolder ведёт каталог нейросетей с 2023 года. Позиции учитывают оценку каталога, отзывы пользователей и популярность сервиса. Список регулярно обновляется.
Только если это разрешает лицензия сервиса — условия у платформ различаются, и коммерческие права часто открываются лишь на платном тарифе. Сами стриминги дополнительно требуют помечать ИИ-происхождение трека.
Современным моделям хватает от нескольких секунд до пары минут чистой речи. Для устойчивого результата без артефактов обычно берут 5–10 минут студийной записи без фонового шума.
Ровный фон — гул, кондиционер, шипение — снимается почти без потерь. С сильной реверберацией и обрывками речи алгоритмы справляются хуже и могут «съесть» согласные.
Синтез дешевле и переделывается за минуту при правке текста, но пока слабее держит длинную эмоциональную подачу. Для навигации, обзвонов и служебных объявлений его берут чаще, для рекламы и аудиокниг — реже.