Ворклог по задаче "Исследовать качественный программный синтез человеческого голоса в браузере"
Уточнение вывода поиска существующих реализаций
Поиск внешних проектов был нужен прежде всего для ответа на один вопрос:
насколько пространство реальной человеческой речи лежит внутри пространства звуков, которое способен воспроизвести компактный процедурный генератор.
Прямого подтверждения этому пока не найдено.
Что при этом известно точно
AudioContext способен качественно воспроизвести любой заранее записанный цифровой звук, если передать ему полный массив samples. Значит, проблема не в браузере как среде воспроизведения.
Проблема — в представлении.
Полный waveform универсален, но дорог: даже сильно сжатая секунда речи остаётся последовательностью из тысяч значений. Наша модель заменяет эту последовательность компактным сценарием из осмысленных параметров и команд во времени.
Поэтому исследуемая граница выглядит так:
полный waveform ← больше данных / выше универсальность ... структурный VoiceScenario → меньше данных / выше управляемость
Нужно понять, где на этой оси появляется качество, достаточное для естественной речи.
Почему найденные проекты не дали ответа
Pink Trombone и похожие физические модели показывают, что можно процедурно генерировать часть voice-like пространства, но:
- они не универсальны;
- в основном демонстрируют гласноподобные состояния и ограниченную артикуляцию;
- звучание остаётся компьютерным;
- нет полноценной демонстрации слогов и качественной связной речи;
- нет обратного декодера
запись → компактный сценарий.
Формантные демо ещё уже: они показывают отдельные статические или почти статические звуки, но не отвечают на вопрос о покрытии реальной речи.
Klatt-подобные системы не являются ориентиром для нашей архитектуры, потому что уже опираются на фонемные/языковые пресеты и не решают универсальную дешифровку произвольного звука.
Neural TTS/codec systems демонстрируют высокое качество, но скрывают внутреннее представление и не дают прозрачного управляемого сценария, который можно исследовать и редактировать.
Новый вывод
Отсутствие найденного примера не означает, что компактный сценарный генератор не способен приблизиться к человеческой речи. Оно означает только, что у нас пока нет внешнего доказательства нужного уровня качества.
Поэтому следующий практический путь — не продолжать бесконечный поиск аналогов, а измерять пределы собственной модели:
- улучшать прямой генератор;
- строить визуальный редактор сценариев для ускорения ручной настройки;
- создать обратный дешифратор и сначала проверять его на собственных синтетических данных с известным ground truth;
- затем переносить его на человеческие записи;
- постепенно увеличивать выразительность представления и измерять, какой прирост качества даёт каждый дополнительный механизм.
Главный объект исследования теперь — компромисс между компактностью структурного описания и perceptual quality.
Найти и изучить браузерные проекты и DSP-подходы, которые программно воспроизводят хотя бы несколько человеческих слогов или голосовых звуков с высоким качеством, без генеративного TTS и без привязки ядра к буквам/слогам.