Ворклог по задаче "Добавить браузерную озвучку букв, слогов и отдельных слов"

15 сент. 2026 г., 21:20:30

Прогресс: ограничения и странности браузерного SpeechSynthesis

Проверена встроенная браузерная озвучка на отдельных словах, слогах и буквах. Для целых слов API в ряде случаев работает приемлемо, но на коротких слогах и отдельных буквах проявляются заметные и непредсказуемые ошибки интерпретации текста.

Что звучит нормально

  • Собака — произносится нормально.
  • Ры — произносится нормально.
  • Свинья — произносится нормально.
  • Пель — неожиданно произносится нормально.

Наблюдаемые сбои

  • Со — звучит примерно как просто С.
  • Р — звучит скорее как Э.
  • Ре — тоже звучит примерно как Э.
  • Свинь — вместо слога начинает читать как названия букв: примерно Эс Вэ Ен Мягкий знак. При этом И и Н отдельно не проговариваются ожидаемо, а часть последовательности интерпретируется как Ен.
  • Ковь — тоже разваливается на чтение по буквам.
  • Солн — также читается по буквам/не как слог.
  • Ко — звучит как Ка.
  • Ар — звучит как А.
  • Де — звучит как Дэ.

Основной вывод

SpeechSynthesisUtterance хорошо подходит для обычных слов и фраз, но не гарантирует корректное произношение искусственно выделенных слогов и отдельных букв.

TTS-движок пытается интерпретировать короткую строку как естественный текст, название буквы, аббревиатуру или неизвестную лексему. Поэтому одинаковая последовательность символов может озвучиваться по-разному в зависимости от длины и контекста.

Особенно проблемны:

  • одиночные согласные;
  • короткие слоги из 2 букв;
  • слоги с ь;
  • обрезанные части слова, которые не являются самостоятельными лексемами;
  • сочетания, похожие на буквенные сокращения.

Практическое следствие

Нельзя считать браузерный TTS универсальным источником правильного произношения для учебной механики буква → слог → слово.

Для целых слов его можно использовать напрямую, но для букв и слогов потребуется один из вариантов:

  1. ручные исключения / словарь альтернативных строк для конкретного TTS;
  2. предварительно записанные аудиофайлы;
  3. отдельный TTS/SSML-движок с более управляемым произношением;
  4. гибрид: слова через браузерный TTS, проблемные буквы/слоги — через подготовленное аудио.

Важно

Эти наблюдения относятся к фактическому поведению текущего браузерного/системного голоса. На другой ОС, браузере или другом SpeechSynthesisVoice результат может отличаться, поэтому подобные исключения нельзя считать универсальными для всех устройств.

15.09.2026

Использовать Web Speech API для воспроизведения учебных единиц: букв, слогов и отдельных слов.