Задача: Сделать визуальный редактор VoiceScenario и цикл человек ↔ ИИ

Сделать визуальный редактор VoiceScenario и цикл человек ↔ ИИ

Ускорить ручной поиск качественных звуков: редактировать сценарии визуально, проигрывать сразу и уметь отправлять эталонный и синтетический логи ИИ-агенту для возврата изменённого JSON.

Цель

Сделать визуальный редактор сценариев синтезатора, чтобы перестать править код ради каждой итерации и перенести работу на уровень самих VoiceScenario.

Что должен уметь редактор

  • загрузить существующий JSON сценария;
  • создать сценарий с нуля;
  • редактировать начальное состояние;
  • редактировать команды общей timeline (set, animate и другие поддерживаемые операции);
  • менять длительности, уровни, частоты, шумовые параметры, резонансы и другие доступные параметры;
  • проигрывать результат сразу после изменения;
  • сохранять и экспортировать изменённый JSON;
  • быстро переключаться между вариантами.

Человек как perceptual validator

Качество результата пока надёжнее всего оценивает человек на слух. Поэтому редактор должен минимизировать цикл:

изменить параметры → проиграть → услышать результат → изменить снова.

Цель — убрать из этого цикла обязательное редактирование исходного кода ИИ.

Автоматизация через ИИ-агента

Следующий слой редактора:

  1. человек загружает/записывает эталонный звук;
  2. система получает его аналитический лог;
  3. проигрывается текущий VoiceScenario и строится его лог;
  4. по кнопке оба лога вместе с текущим JSON отправляются ИИ-агенту;
  5. агент сравнивает их и возвращает изменённый JSON сценария;
  6. редактор применяет вариант;
  7. человек проверяет его на слух.

ИИ здесь не является финальным судьёй качества — он помогает искать изменения в структурированном пространстве параметров, а человек остаётся проверяющим perceptual quality.

Отдельно проверить качество логов

Есть гипотеза, что текущие аналитические логи слишком сильно сжаты и теряют признаки, которые человек слышит. Нужно иметь возможность увеличивать разрешение анализа и сравнить, улучшает ли это способность ИИ предлагать полезные изменения.

Важный режим исследования

Не выбрасывать случайно найденные полезные звуки.

Если при поиске Ха получается узнаваемое Ва или другой нужный голосовой фрагмент:

  • сохранить сценарий как отдельный результат;
  • сохранить исходный и изменённый варианты;
  • зафиксировать, какие изменения параметров привели к переходу;
  • использовать это как знание о структуре параметрического пространства.

Критерий результата

Редактор должен сделать итерации над звуком существенно дешевле: человек способен самостоятельно менять и проверять сценарии, а ИИ работает с JSON/логами вместо постоянного изменения кода.