Nhiệm vụ
Nghiên cứu lý thuyết về các thuộc tính của PCM và tín hiệu giọng nói mà chúng ta có thể đảm bảo đo lường được theo thời gian và tần số trước khi thiết kế bộ tạo tín hiệu mới.
Trình chỉnh sửa đa rãnh tương tác để thử nghiệm thủ công với các thông số tổng hợp theo thời gian, nghe lặp lại và tìm kiếm các âm thanh thú vị.
Xây dựng bản đồ thực nghiệm về cách các thay đổi của tham số điều khiển theo thời gian thể hiện trong PCM và các đặc trưng âm học, có tính đến độ trễ và bộ nhớ của DSP.
Kiểm tra xem kịch bản của bộ tạo có thể được khôi phục tự động từ âm thanh được ghi lại hay không, trước tiên trên các ví dụ tổng hợp của riêng chúng tôi với ground truth đã biết, sau đó là trên giọng nói của con người.
Tăng tốc quá trình tìm kiếm âm thanh chất lượng thủ công: chỉnh sửa kịch bản trực quan, phát ngay lập tức và có khả năng gửi nhật ký chuẩn và tổng hợp cho tác nhân AI để nhận lại JSON đã sửa đổi.
Tìm kiếm và nghiên cứu các dự án trên trình duyệt và các phương pháp DSP có thể tái tạo ít nhất một vài âm tiết hoặc âm thanh giọng nói của con người với chất lượng cao theo cách lập trình, không dùng TTS tạo sinh và không gắn kết phần nhân với chữ cái/âm tiết.