Ворклог по задаче "Исследовать параметрический синтез русских звуков и переходов между ними"

14 сент. 2026 г., 09:25:00

Новый прогресс: структурное представление звука и цикл человек ↔ ИИ

Зафиксированы несколько обнадёживающих признаков текущего прототипа.

1. Мы уже работаем не с waveform, а с компактной программой

Текущий синтезатор оперирует отдельными переменными начального состояния и отдельными сценариями на общей timeline. Это принципиально отличается от прямого хранения нескольких тысяч/десятков тысяч отсчётов.

Несмотря на грубость модели, из сравнительно малого числа параметров уже получаются звуки, которые человек иногда распознаёт как буквы/фонемные фрагменты или слоги. Это ещё не доказывает достаточность модели для естественной речи, но показывает, что параметрическое пространство не является полностью хаотичным.

2. Человек фактически выполняет роль perceptual validator

ИИ не имеет надёжного эталона того, насколько натурально звучит синтез. Поэтому текущий рабочий цикл выглядит так:

ожидаемый звук → сценарий → синтез → человек слушает → оценивает качество → ИИ предлагает изменения параметров → новый синтез.

Человек здесь даёт финальную perceptual feedback, а ИИ помогает анализировать структурные различия и двигаться по пространству параметров.

3. Использование реальной записи как локального ориентира

При поиске звука Ха была использована запись слова/фразы КуХаРе, где нужный участок реально присутствует. ИИ получил:

  • лог синтетического варианта;
  • лог реальной записи;
  • информацию о том, где в записи находится целевой фрагмент.

Далее он сравнивает структурные признаки и предлагает, какие параметры сценария можно изменить, чтобы приблизиться к нужному участку.

Это не даёт мгновенного результата, но выглядит как рабочий человеко-ИИ цикл приближения к целевому звуку.

4. Возможно, текущие логи слишком сильно сжаты

Есть подозрение, что качество аналитических логов недостаточно для точного сравнения. Если человек слышит различия, которых ИИ не может вывести из лога, bottleneck может находиться не только в генераторе, но и в разрешении анализа.

Нужно отдельно проверять, как меняется качество предложений ИИ при уменьшении сжатия логов и увеличении числа временных/спектральных признаков.

5. Случайно найденные реальные звуки — тоже знание

При поиске Ха один из вариантов был воспринят как Ва.

Это полезно по двум причинам:

  1. найденный звук сам по себе может быть нужен позже;
  2. переход от предыдущего «шипения» к воспринимаемому Ва показывает направление в параметрическом пространстве.

Такие случайные находки нужно сохранять вместе с изменениями параметров, потому что они помогают картировать пространство возможных звуков.

6. Пространство пока остаётся в области speech-like sounds

Несмотря на потенциальную универсальность AudioContext, при изменениях параметров текущего voice-oriented генератора мы пока в основном сталкиваемся со звуками, которые воспринимаются как голосовые/фонетические или близкие к ним, а не как случайные реальные звуки вроде лая, птичьего пения или стука копыт.

Это не доказывает универсальность и не доказывает полноту покрытия человеческой речи. Более осторожный вывод:

текущая архитектура генератора уже содержит сильный inductive bias в сторону voice-like sound space.

Это может быть полезным свойством, потому что поиск происходит не по всему возможному аудиопространству, а по более узкой области.

7. Уточнённая практическая цель

Теперь основной вопрос не только «какие параметры нужны для синтеза речи», а:

насколько компактно можно описать нужную область человеческой речи, не возвращаясь обратно к тысячам samples.

Крайние точки уже понятны:

  • waveform / μ-law — высокое качество и универсальность, но тысячи значений в секунду;
  • VoiceScenario — компактность и управляемость, но пока неизвестные пределы качества.

Дальнейшая работа должна исследовать промежуток между ними и зависимость:

качество ↑ ↔ сложность/размер представления ↑.

Возможный путь — постепенно добавлять только те механизмы, которые дают заметный perceptual gain, сохраняя структурность модели.

13.09.2026

Исследовать параметрический синтез русских звуков и переходов между ними.