Задача: Сделать визуальный редактор VoiceScenario и цикл человек ↔ ИИ
Сделать визуальный редактор VoiceScenario и цикл человек ↔ ИИ
Ускорить ручной поиск качественных звуков: редактировать сценарии визуально, проигрывать сразу и уметь отправлять эталонный и синтетический логи ИИ-агенту для возврата изменённого JSON.
Цель
Сделать визуальный редактор сценариев синтезатора, чтобы перестать править код ради каждой итерации и перенести работу на уровень самих VoiceScenario.
Что должен уметь редактор
- загрузить существующий JSON сценария;
- создать сценарий с нуля;
- редактировать начальное состояние;
- редактировать команды общей timeline (
set,animateи другие поддерживаемые операции); - менять длительности, уровни, частоты, шумовые параметры, резонансы и другие доступные параметры;
- проигрывать результат сразу после изменения;
- сохранять и экспортировать изменённый JSON;
- быстро переключаться между вариантами.
Человек как perceptual validator
Качество результата пока надёжнее всего оценивает человек на слух. Поэтому редактор должен минимизировать цикл:
изменить параметры → проиграть → услышать результат → изменить снова.
Цель — убрать из этого цикла обязательное редактирование исходного кода ИИ.
Автоматизация через ИИ-агента
Следующий слой редактора:
- человек загружает/записывает эталонный звук;
- система получает его аналитический лог;
- проигрывается текущий
VoiceScenarioи строится его лог; - по кнопке оба лога вместе с текущим JSON отправляются ИИ-агенту;
- агент сравнивает их и возвращает изменённый JSON сценария;
- редактор применяет вариант;
- человек проверяет его на слух.
ИИ здесь не является финальным судьёй качества — он помогает искать изменения в структурированном пространстве параметров, а человек остаётся проверяющим perceptual quality.
Отдельно проверить качество логов
Есть гипотеза, что текущие аналитические логи слишком сильно сжаты и теряют признаки, которые человек слышит. Нужно иметь возможность увеличивать разрешение анализа и сравнить, улучшает ли это способность ИИ предлагать полезные изменения.
Важный режим исследования
Не выбрасывать случайно найденные полезные звуки.
Если при поиске Ха получается узнаваемое Ва или другой нужный голосовой фрагмент:
- сохранить сценарий как отдельный результат;
- сохранить исходный и изменённый варианты;
- зафиксировать, какие изменения параметров привели к переходу;
- использовать это как знание о структуре параметрического пространства.
Критерий результата
Редактор должен сделать итерации над звуком существенно дешевле: человек способен самостоятельно менять и проверять сценарии, а ИИ работает с JSON/логами вместо постоянного изменения кода.