Nhật ký công việc cho nhiệm vụ "Nghiên cứu tổng hợp phần mềm chất lượng cao giọng nói con người trên trình duyệt"
13 сент. 2026 г., 15:11:57
Giới hạn vật lý cơ bản để tái tạo giọng nói chất lượng cao và các mốc tham chiếu cho tiếng Nga đã được nghiên cứu.
Các kết luận chính:
- Một kênh âm thanh duy nhất (mono) là đủ để tái tạo giọng nói con người: tại một điểm trong không gian, áp suất không khí được mô tả bằng một hàm thời gian vô hướng duy nhất. Stereo cần thiết cho các đặc trưng không gian, chứ không phải cho âm sắc hoặc khả năng dễ hiểu của âm vị giọng nói.
- Tiếng nói băng thông rộng ITU (wideband speech): khoảng 50–7000 Hz. Theo định lý Nyquist, để giữ lại dải này cần tần số lấy mẫu >14 kHz; tiêu chuẩn thực tế là 16 kHz. Điều này cho ra raw PCM 16-bit mono = 16.000 * 16 = 256 kbps.
- Tiếng nói siêu băng thông rộng ITU (super-wideband): 50–14.000 Hz; tần số lấy mẫu thực tế >=32 kHz, raw PCM 16-bit mono = 512 kbps. 48 kHz/16-bit mono = 768 kbps và đã bao phủ toàn bộ dải thính giác của con người rộng hơn nhiều so với mức thường cần cho giọng nói.
- Đối với giọng nói nén, Opus RFC 6716 chỉ định các mức tối ưu (sweet spots): 8–12 kbps cho tiếng nói băng hẹp (narrowband), 16–20 kbps cho tiếng nói băng rộng (wideband), 28–40 kbps cho tiếng nói toàn dải (fullband).
- G.722 xác định tiếng nói băng rộng chất lượng cao 50–7000 Hz ở mức 64 kbps (codec SB-ADPCM cũ); Opus hiện đại đạt được hiệu suất chủ quan tương đương hoặc tốt hơn với bitrate thấp hơn đáng kể.
- OpenSTT của Nga (~20 nghìn giờ) sử dụng mono, 16 kHz, int16 làm định dạng thực tế chính; cấu hình MP3 trước đây của họ là 16 kHz mono 32 kbps. Đây là một mốc cơ sở thực nghiệm hữu ích của tiếng Nga, dù không phải là mức tối thiểu cơ bản.
Điều quan trọng là phải phân biệt giữa bitrate lưu trữ/truyền tải và độ phức tạp của bộ tổng hợp: một kênh âm thanh đầu ra duy nhất có thể được tạo ra từ nhiều nguồn/bộ lọc bên trong (nguồn thanh môn, tiếng thở, tiếng xát, cộng hưởng, nhánh mũi, v.v.). Số lượng thành phần DSP bên trong không bằng số lượng kênh âm thanh đầu ra.
13.09.2026
Tìm kiếm và nghiên cứu các dự án trên trình duyệt và các phương pháp DSP có thể tái tạo ít nhất một vài âm tiết hoặc âm thanh giọng nói của con người với chất lượng cao theo cách lập trình, không dùng TTS tạo sinh và không gắn kết phần nhân với chữ cái/âm tiết.