Ворклог по задаче "Исследовать и реализовать локальную TTS-озвучку через локальный сервер"
Найден рабочий локальный вариант TTS
Локально в Docker поднят VieNeu-TTS, сейчас используется версия 2.
Главный практический результат: модель стабильно озвучивает одиночные вьетнамские графемы, включая формы с тоновыми знаками. Это закрывает ключевую проблему, из-за которой OpenRouter/Gemini не подходил для букваря: минимальные входы вроде одной буквы там давали HTTP 400 или нестабильный результат.
Проверен набор из 18 форм группы a / ă / â с шестью тонами (a á à ả ã ạ, ă ắ ằ ẳ ẵ ặ, â ấ ầ ẩ ẫ ậ). VieNeu-TTS умеет адресно генерировать такие единицы, поэтому его можно использовать как генератор фонетического словаря: графема/слог → сохранённый аудиофайл.
Следующий шаг — прогнать более широкий набор букв, слогов и коротких слов, проверить качество с носителями языка и затем подключить локальный генератор к постоянному хранилищу аудио, чтобы не синтезировать записи повторно при каждом воспроизведении.
Связанная родительская задача: «Разработать собственный пайплайн озвучки вьетнамского языка и словарь аудио».
Обойти ограничение OpenRouter при озвучке одиночных букв и проверить локальный TTS-пайплайн для вьетнамского языка через собственный сервер.