Nhật ký công việc cho nhiệm vụ "Khảo sát bộ giải mã ngược: âm thanh → VoiceScenario"
Tiến độ về trực quan hóa và giải mã nghịch đảo
Đã kiểm tra lại ngữ nghĩa của VoiceScenario theo việc triển khai thực tế của synthesizeScenario.
Những gì đã được xác nhận
animate.toKHÔNG được đặt lại sau khidurationkết thúc. Khi quá trình tự động hóa hoàn tất,state[param] = to, bản thân tự động hóa bị xóa, nhưng giá trị mới vẫn hoạt động cho đến lệnh tiếp theo.setcũng thay đổi trạng thái vĩnh viễn cho đến khi tham số được thay đổi lần nữa.- Một lệnh
animatemới bắt đầu từ giá trị hiện tại thực tế của tham số tại thời điểm thực thi lệnh. - Đối với một mảng kịch bản,
initialchỉ được sử dụng cho kịch bản đầu tiên, các kịch bản tiếp theo tiếp tục trạng thái hiện tại mà không cần đặt lại (reset).
Vấn đề đã tìm thấy ở bộ trực quan hóa (Visualizer)
ScenarioVisualizer cũ chỉ hiển thị các phần animate đang hoạt động, khiến kịch bản ban đầu trông có vẻ "đứt đoạn" về mặt hình ảnh. Điều này không tương ứng với trạng thái thực tế của bộ tổng hợp.
Bộ trực quan hóa đã được thiết kế lại để hiển thị toàn bộ VoiceControlState(t): các giá trị chạy liên tục từ đầu đến cuối kịch bản, bao gồm việc giữ giá trị to cuối cùng sau khi duration kết thúc, set, việc ngắt các tự động hóa cũ và tiếp tục trạng thái giữa các kịch bản ghép nối.
Kết luận về kiến trúc
Logic thực thi kịch bản (prepareScenario, evaluateBezier, updateAutomations, executeCommand) không được trùng lặp giữa bộ tổng hợp và bộ trực quan hóa. Một tác vụ riêng biệt đã được tạo để tách mô-đun thời gian chạy (runtime) chung, sao cho DSP và bộ trực quan hóa sử dụng cùng một cỗ máy trạng thái (state machine).
Kết luận về bộ giải mã hiện tại
Ngay cả sau khi sửa lỗi trực quan hóa, có thể thấy rằng nhật ký (log) và kịch bản hiện tại đang ở các cấp độ biểu diễn khác nhau. Kịch bản chứa các tham số điều khiển, trong khi nhật ký chứa các đặc trưng âm học quan sát được. Sự tương ứng trực tiếp kiểu RMS -> sourceLevel, dominantFrequency -> f0Hz, v.v., trong trường hợp tổng quát là không chính xác.
Cũng đã được xác nhận rằng kịch bản gốc có nhiều tham số điều khiển hơn đáng kể so với nhật ký các chỉ số âm học hiện tại, do đó tính khả nghịch của Scenario -> Sound -> Log -> Scenario bị thiếu xác định về mặt vật lý trong kiến trúc hiện tại.
Kiểm tra xem kịch bản của bộ tạo có thể được khôi phục tự động từ âm thanh được ghi lại hay không, trước tiên trên các ví dụ tổng hợp của riêng chúng tôi với ground truth đã biết, sau đó là trên giọng nói của con người.