TTS и STT

tts и stt — синтез и распознавание речи

Раздел
Видео
Обновлено
11.08.26

STT превращает запись речи в текст, а TTS — текст в звучащую речь. Вместе они лежат в основе транскрипции, дубляжа и голосовых интерфейсов. Качество зависит не только от модели, но и от записи, языка, сегментации, словаря и проверки результата.

Коротко

Коротко. Speech-to-Text распознаёт речь и выдаёт текст с временными метками. Text-to-Speech синтезирует голос по тексту. В голосовом помощнике они образуют цепочку STT → языковая модель → TTS, но каждый этап добавляет собственную задержку и ошибки.

Что делает STT

STT, ASR или распознавание речи принимает аудиосигнал и возвращает транскрипцию. В зависимости от системы результат может включать:

  • текст;
  • временные метки слов или сегментов;
  • определение языка;
  • разделение по говорящим;
  • оценку уверенности;
  • знаки препинания и нормализацию чисел.

Это разные задачи. Модель может верно распознать слова и ошибиться в разделении спикеров или времени.

Что делает TTS

TTS превращает текст в аудио. Современные системы моделируют не только фонемы, но и темп, паузы, ударения, интонацию и особенности голоса.

Вход может включать:

  • обычный текст;
  • выбранный голос;
  • язык и стиль;
  • фонетическую подсказку;
  • разметку пауз и ударений;
  • образец голоса, если клонирование разрешено.

Хорошая дикция не гарантирует естественную драматургию. Длинный текст обычно требует редакторской разметки и прослушивания.

Как работает STT

Упрощённая цепочка выглядит так:

  1. Аудио приводится к поддерживаемому формату и частоте дискретизации.
  2. Сигнал разбивается на кадры и превращается в спектральные признаки или подаётся в обучаемый аудиоэнкодер.
  3. Модель связывает акустическое представление с текстовыми токенами.
  4. Декодер выбирает последовательность слов с учётом языка и контекста.
  5. Постобработка добавляет пунктуацию, таймкоды и оформление.

Плохой микрофон, эхо, музыка, наложение голосов и редкие имена могут влиять сильнее, чем разница между соседними моделями.

Как работает TTS

Одна распространённая схема:

  1. Текст нормализуется: числа, сокращения и символы превращаются в произносимую форму.
  2. Модель строит языковое и фонетическое представление.
  3. Акустическая часть предсказывает ритм, высоту и спектральные признаки.
  4. Вокодер превращает представление в звуковую волну.

Архитектуры отличаются, а некоторые модели объединяют этапы. Для пользователя важнее итог: разборчивость, естественность, стабильность голоса и контроль произношения.

Наглядный пример

Редакция готовит русскую версию интервью.

Сначала STT делает транскрипцию с таймкодами и разделением спикеров. Редактор сверяет имена и места, где люди говорят одновременно. Затем перевод адаптируется под длину реплик. TTS озвучивает каждую роль, после чего звукорежиссёр выравнивает паузы и громкость.

Если сразу отправить сырую транскрипцию в синтез, ошибки распознавания превратятся в убедительно произнесённые ошибки. Проверка между этапами экономит больше времени, чем попытка исправить финальный микс.

Потоковый и пакетный режим

Пакетная обработка получает готовый файл или текст целиком. У модели больше контекста, а задержка менее критична.

Streaming работает по мере поступления аудио или генерирует звук кусками. Он нужен для диалога, но приходится балансировать задержку и стабильность: ранний результат может измениться после следующей фразы.

Для голосового интерфейса измеряют не только время модели, а весь путь от конца реплики пользователя до начала понятного ответа.

Как выбирать STT

Сравнение проводят на собственных записях и отдельно по важным группам:

  • язык, акцент и переключение языков;
  • телефон, студия и шумная улица;
  • короткие команды и длинная речь;
  • имена, адреса и профессиональные термины;
  • один голос и перекрывающиеся спикеры.

Для обычной транскрипции используют WER или CER, но важные сущности лучше оценивать отдельно. Ошибка в предлоге и ошибка в дозировке имеют разный вес.

Как выбирать TTS

Полезен слепой тест на фразах, которых не было в примерах. Слушатели оценивают:

  • разборчивость;
  • естественность;
  • верные ударения;
  • стабильность тембра;
  • эмоциональное соответствие;
  • артефакты на длинных фразах;
  • сходство, если используется разрешённый клон.

Средняя оценка не должна скрывать критические ошибки в именах, числах и предупреждениях.

Облако и локальный запуск

Облачный сервис проще масштабировать и обновлять, но он обрабатывает аудио вне вашей инфраструктуры и имеет меняющиеся тарифы и ограничения. Локальная модель даёт больше контроля, но требует собственного оборудования, обновлений и защиты.

Для чувствительных записей проверяют согласие, регион обработки, срок хранения, использование данных для обучения и доступ операторов. Эти условия не выводятся из качества голоса.

Голосовое клонирование

Клонирование — частный случай TTS. Техническая возможность воспроизвести тембр не даёт права использовать чужой голос. Нужны согласие, разрешённая цель, понятное хранение образцов и способ отозвать доступ.

Голос также нельзя считать надёжным паролем: синтез и запись позволяют имитировать человека. Для важных распоряжений нужна независимая проверка.

TTS и STT в ComfyUI

Голосовые этапы можно встроить в workflow через поддерживаемые API или custom nodes. Сам ComfyUI не задаёт единую модель распознавания или синтеза. Перед установкой расширения проверяют источник, зависимости и передачу аудио внешнему сервису.

Для воспроизводимости граф сохраняет название модели, язык, параметры сегментации, формат аудио и версию ноды. Секреты остаются в переменных окружения или защищённом хранилище.

Частые ошибки

  • Считать STT готовой стенограммой. Имена, числа и говорящие требуют проверки.
  • Измерять только средний WER. Критические сущности могут ошибаться чаще.
  • Озвучивать сырой письменный текст. Устная фраза требует другого ритма и длины.
  • Смешивать языки без теста. Автоопределение может переключиться не там.
  • Оценивать TTS по одной красивой реплике. Длинный материал выявляет дрейф голоса и пауз.
  • Клонировать голос без согласия. Это правовой и этический риск, а не настройка качества.

Частые вопросы

Whisper — всегда лучший STT?

Нет универсально лучшей модели. Whisper удобен для локального и многоязычного распознавания, но другой сервис или специализированная модель может лучше работать на конкретном языке, канале и словаре.

Можно ли работать в реальном времени?

Да, если модель и инфраструктура поддерживают потоковый режим или достаточно быструю обработку сегментов. Итоговая задержка включает сеть, детектор конца реплики, LLM и TTS.

Как исправлять редкие слова?

Помогают качественная запись, языковая подсказка, словарь или contextual biasing, а также постпроверка по справочнику. Набор возможностей зависит от движка.

Главное

STT и TTS связывают человеческую речь с текстовым миром AI. Надёжный процесс не прячет ошибки под естественным голосом: запись очищается, распознавание проверяется, текст адаптируется, синтез прослушивается. Модель выбирают по своему языку и акустике, а не по общему рейтингу.