Раздел про распознавание речи: на входе аудио или видео, на выходе — текст. Сюда попадают расшифровщики созвонов и интервью, генераторы субтитров, диктофоны с автопротоколом и системы для разбора записей звонков. Сервисы различаются не столько «понимает или нет», сколько тем, как ведут себя на реальной записи: держат ли русскую речь с перебиваниями, отделяют ли говорящих друг от друга и что отдают на выходе — сплошной текст, файл субтитров с тайм-кодами или структурированный протокол с задачами. В каталоге — 124 нейросети. Есть 10 с бесплатным тарифом.

WhisperUI Speech Text от OpenAI эффективно и с высокой точностью расшифровывает аудиофайлы на нескольких языках.

инструменты ии, обеспечивающие преобразование речи в текст, преобразование текста в речь и расширенную генерацию текста.


Нейросеть для анализа и участия в беседах на Twitter Spaces.

нейросеть, которая за считанные секунды генерирует точные расшифровки видео YouTube.
NeuroFolder ведёт каталог нейросетей с 2023 года. Позиции учитывают оценку каталога, отзывы пользователей и популярность сервиса. Список регулярно обновляется.
На чистой записи с одним говорящим современные модели ошибаются редко, но шум, перебивания, имена и профессиональные термины заметно роняют качество. Вычитка после расшифровки нужна почти всегда.
Да, двумя способами: бот-участник подключается к встрече и пишет протокол сам, либо вы загружаете уже готовую запись файлом. Первый вариант есть не у всех — проверяйте список интеграций.
Бесплатные тарифы обычно ограничены минутами в месяц или длиной одного файла. Длинные записи либо режут на части, либо расшифровывают на платном тарифе с поминутной оплатой.
Да, если сервис отдаёт SRT или VTT с тайм-кодами — такой файл загружается на видеоплощадку как есть. Чтобы вшить субтитры прямо в кадр, понадобится ещё видеоредактор.