Nhiệm vụ: Xây dựng Trình chỉnh sửa trực quan VoiceScenario và vòng lặp Con người ↔ AI
Xây dựng Trình chỉnh sửa trực quan VoiceScenario và vòng lặp Con người ↔ AI
Tăng tốc quá trình tìm kiếm âm thanh chất lượng thủ công: chỉnh sửa kịch bản trực quan, phát ngay lập tức và có khả năng gửi nhật ký chuẩn và tổng hợp cho tác nhân AI để nhận lại JSON đã sửa đổi.
Mục tiêu
Xây dựng trình chỉnh sửa kịch bản bộ tổng hợp trực quan để ngừng việc sửa đổi mã nguồn cho mỗi lần lợt lặp và chuyển công việc lên cấp độ của chính VoiceScenario.
Trình chỉnh sửa cần có khả năng gì
- tải tệp JSON kịch bản hiện có;
- tạo kịch bản từ đầu;
- chỉnh sửa trạng thái ban đầu;
- chỉnh sửa các lệnh trên dòng thời gian chung (
set,animatevà các thao tác được hỗ trợ khác); - thay đổi thời lượng, mức độ, tần số, thông số tiếng ồn, độ cộng hưởng và các thông số có sẵn khác;
- phát kết quả ngay sau khi thay đổi;
- lưu và xuất tệp JSON đã sửa đổi;
- chuyển đổi nhanh chóng giữa các biến thể.
Con người là Trình kiểm định nhận thức (Perceptual Validator)
Chất lượng kết quả cho đến nay vẫn được đánh giá bằng tai đáng tin cậy nhất bởi con người. Do đó, trình chỉnh sửa nên giảm thiểu tối đa chu kỳ:
thay đổi thông số → phát → nghe kết quả → thay đổi lại.
Mục tiêu là loại bỏ việc bắt buộc chỉnh sửa mã nguồn của AI khỏi chu kỳ này.
Tự động hóa thông qua Tác nhân AI
Lớp tiếp theo của trình chỉnh sửa:
- con người tải lên/ghi lại âm thanh chuẩn;
- hệ thống nhận nhật ký phân tích của âm thanh đó;
VoiceScenariohiện tại được phát và xây dựng nhật ký của nó;- khi nhấn nút, cả hai nhật ký cùng với JSON hiện tại được gửi cho tác nhân AI;
- tác nhân so sánh chúng và trả về JSON kịch bản đã sửa đổi;
- trình chỉnh sửa áp dụng biến thể;
- con người kiểm tra lại bằng tai.
AI ở đây không phải là trọng tài cuối cùng về chất lượng — nó giúp tìm kiếm các thay đổi trong không gian thông số có cấu trúc, trong khi con người vẫn đóng vai trò là người kiểm tra chất lượng cảm nhận (perceptual quality).
Kiểm tra riêng chất lượng nhật ký
Có giả thuyết cho rằng các nhật ký phân tích hiện tại bị nén quá mức và làm mất các đặc điểm mà con người có thể nghe thấy. Cần có khả năng tăng độ phân giải phân tích và so sánh xem điều này có cải thiện khả năng đề xuất các thay đổi hữu ích của AI hay không.
Chế độ nghiên cứu quan trọng
Không vứt bỏ những âm thanh hữu ích vô tình tìm thấy.
Nếu khi tìm kiếm Ha mà lại tạo ra được Va dễ nhận biết hoặc một phân đoạn giọng nói mong muốn khác:
- lưu kịch bản thành một kết quả riêng biệt;
- lưu cả biến thể gốc và biến thể đã sửa đổi;
- ghi lại những thay đổi thông số nào đã dẫn đến sự chuyển đổi đó;
- sử dụng điều này làm kiến thức về cấu trúc của không gian tham số.
Tiêu chí kết quả
Trình chỉnh sửa phải làm cho các vòng lặp âm thanh trở nên tiết kiệm chi phí hơn đáng kể: con người có thể tự mình thay đổi và kiểm tra các kịch bản, còn AI làm việc với JSON/nhật ký thay vì phải liên tục thay đổi mã nguồn.