Озвучка и аудиослой курса вьетнамского языка
Озвучка и аудиослой курса вьетнамского языка
Для вьетнамского аудио — не декоративная функция, а базовая часть учебного материала. Тоны, качество гласных и финали должны быть доступны в реальном звучании.
Почему нельзя полагаться только на browser speechSynthesis
Первичное исследование показало, что наличие вьетнамского голоса в браузере нельзя считать гарантированным. Установка дополнительных голосов зависит от конечного поставщика, может быть неудобна и нестабильна, а заставлять пользователя устанавливать системные словари нельзя.
Кроме того, разработчик, не являющийся носителем языка, не может гарантировать качество произношения только по факту успешного синтеза.
Собственный словарь аудио
Рабочая архитектура курса должна хранить заранее подготовленные озвучки:
- учебная единица (буква, слог, слово, фраза);
- генерация или запись аудио;
- сохранение файла;
- метаданные модели/голоса/варианта произношения;
- статус проверки;
- многократное повторное использование.
Озвучку не нужно генерировать заново при каждом воспроизведении.
Проверка носителем
Для критичных элементов — особенно тонов и минимальных фонетических контрастов — нужен этап проверки носителем языка. Полезно предусмотреть состояния «сгенерировано», «требует проверки», «подтверждено», «отклонено» и возможность заменить синтетический вариант живой записью.
Диалекты
При необходимости словарь аудио должен позволять хранить несколько вариантов одной единицы: например северный и южный.
Текущие технические исследования
Основной TTS-пайплайн исследуется отдельно; обнаружено также ограничение OpenRouter на некоторые минимальные входы вроде одной буквы, поэтому рассматривается локальный TTS-сервер.
Связи
Звуковой материал должен быть непосредственно связан с Фонетикой, Тонами, Диалектами и Методикой обучения.