Nhật ký công việc cho nhiệm vụ "Nghiên cứu tổng hợp phần mềm chất lượng cao giọng nói con người trên trình duyệt"
Làm rõ kết quả tìm kiếm các triển việc hiện thực hóa hiện có
Việc tìm kiếm các dự án bên ngoài chủ yếu là cần thiết để trả lời một câu hỏi:
không gian của lời nói thực tế của con người nằm trong không gian âm thanh mà một trình tạo thủ tục nhỏ gọn có thể tái tạo đến mức độ nào.
Hiện tại vẫn chưa tìm thấy sự xác nhận trực tiếp cho điều này.
Những gì đã biết chắc chắn
AudioContext có khả năng tái tạo chất lượng cao bất kỳ âm thanh kỹ thuật số nào được ghi lại trước đó nếu cung cấp cho nó toàn bộ mảng mẫu (samples). Điều này có nghĩa là vấn đề không nằm ở trình duyệt như một môi trường phát lại.
Vấn đề nằm ở sự biểu diễn.
Dạng sóng (waveform) đầy đủ có tính phổ quát nhưng tốn kém: ngay cả một giây giọng nói bị nén mạnh vẫn là một chuỗi gồm hàng nghìn giá trị. Mô hình của chúng tôi thay thế chuỗi này bằng một kịch bản nhỏ gọn gồm các tham số và lệnh có ý nghĩa theo thời gian.
Do đó, ranh giới đang được nghiên cứu trông như thế này:
waveform đầy đủ ← nhiều dữ liệu hơn / tính phổ quát cao hơn ... VoiceScenario cấu trúc → ít dữ liệu hơn / khả năng điều khiển cao hơn
Chúng ta cần hiểu trên trục này, chất lượng đủ cho lời nói tự nhiên xuất hiện ở đâu.
Tại sao các dự án tìm thấy không đưa ra câu trả lời
Pink Trombone và các mô hình vật lý tương tự cho thấy rằng có thể tạo ra một phần của không gian giống giọng nói bằng thủ tục, nhưng:
- chúng không phổ quát;
- chủ yếu thể hiện các trạng thái giống nguyên âm và khả năng phát âm hạn chế;
- âm thanh vẫn mang tính máy tính;
- không có sự minh họa đầy đủ về các âm tiết và lời nói liên tục chất lượng cao;
- không có bộ giải mã ngược
bản ghi → kịch bản nhỏ gọn.
Các bản demo định dạng (formant) thậm chí còn hẹp hơn: chúng hiển thị các âm thanh tĩnh riêng lẻ hoặc gần như tĩnh, nhưng không trả lời câu hỏi về việc bao phủ lời nói thực tế.
Các hệ thống giống Klatt không phải là tiêu chuẩn tham chiếu cho kiến trúc của chúng tôi, bởi vì chúng đã dựa trên các cài đặt sẵn về âm vị/ngôn ngữ và không giải quyết việc giải mã phổ quát của âm thanh tùy ý.
Các hệ thống TTS/codec thần kinh thể hiện chất lượng cao, nhưng ẩn đi phần biểu diễn bên trong và không cung cấp một kịch bản minh bạch, có thể điều khiển để khám phá và chỉnh sửa.
Kết luận mới
Việc không tìm thấy ví dụ nào không có nghĩa là trình tạo dựa trên kịch bản nhỏ gọn không thể tiếp cận lời nói của con người. Nó chỉ có nghĩa là chúng ta chưa có bằng chứng bên ngoài về mức chất lượng cần thiết.
Do đó, con đường thực tế tiếp theo không phải là tiếp tục tìm kiếm vô tận các giải pháp thay thế, mà là đo lường các giới hạn của mô hình chính chúng ta:
- cải tiến trình tạo trực tiếp;
- xây dựng một trình chỉnh sửa kịch bản trực quan để đẩy nhanh quá trình điều chỉnh thủ công;
- tạo ra một bộ giải mã ngược và kiểm tra nó trước tiên trên dữ liệu tổng hợp của chính chúng ta với ground truth đã biết;
- sau đó chuyển nó sang các bản ghi âm của con người;
- dần dần tăng độ biểu cảm của phần biểu diễn và đo lường mức độ cải thiện chất lượng mà mỗi cơ chế bổ sung mang lại.
Đối tượng nghiên cứu chính bây giờ là sự đánh đổi giữa tính nhỏ gọn của mô tả cấu trúc và chất lượng cảm nhận (perceptual quality).
Tìm kiếm và nghiên cứu các dự án trên trình duyệt và các phương pháp DSP có thể tái tạo ít nhất một vài âm tiết hoặc âm thanh giọng nói của con người với chất lượng cao theo cách lập trình, không dùng TTS tạo sinh và không gắn kết phần nhân với chữ cái/âm tiết.