Nhật ký công việc cho nhiệm vụ "Tạo phòng thí nghiệm trực quan kịch bản thời gian VoiceSynthesizer"

14 сент. 2026 г., 23:26:00

Tiến độ chi tiết về Phòng thí nghiệm Trực quan Kịch bản Thời gian

Những gì đã được triển khai

Một bộ tổng hợp thử nghiệm và trình soạn thảo trực quan mới, tách biệt đã được tạo ra, có chủ ý không liên kết với VoiceSynthesizer trước đây và mô hình DSP phức tạp tích lũy của nó.

Quyết định kiến trúc quan trọng này được đưa ra một cách có ý thức: mục tiêu của giai đoạn hiện tại không phải là duy trì khả năng tương thích với các kịch bản cũ hay tái tạo các thí nghiệm trong quá khứ, mà là có được một bệ thử nghiệm trong phòng thí nghiệm sạch sẽ nhất có thể để nghiên cứu âm thanh thủ công.

Cấu trúc hiện tại bao gồm:

  • trình soạn thảo nhiều bản nhạc (multi-track) cho các tham số thời gian;
  • các điểm keyframe trên một trục thời gian chung;
  • kéo-thả (drag-and-drop) theo thời gian và theo giá trị;
  • Play / Pause / Stop;
  • Chế độ Loop;
  • thời lượng tổng thể của kịch bản độc lập;
  • tua (seek) trên timeline;
  • hiển thị các giá trị tham số hiện tại;
  • các kiểu chuyển đổi hold, linear, bezier, sine, burst, noise;
  • tổng hợp âm thanh mới riêng biệt dựa trên Web Audio API;
  • mô hình âm học tối thiểu dựa trên sawtooth + noise + formant filters + gain.

Giao diện người dùng hiện hiển thị các bản nhạc thử nghiệm chính:

  • F0 / Pitch;
  • Periodicity;
  • Noise;
  • Formant 1;
  • Formant 2;
  • Formant 3;
  • Gain.

Giao diện trực quan cho thấy kết quả tốt như một công cụ phòng thí nghiệm: trục thời gian dễ đọc, các sự kiện có thể nhìn thấy, các tham số có thể được thay đổi nhanh chóng và tổng thời lượng không bị ràng buộc vào điểm cuối cùng. Điều này cho phép xây dựng các âm thanh kéo dài và chuỗi trạng thái dài.

Làm rõ quan trọng về định hướng

Trình soạn thảo mới KHÔNG nên đóng vai trò là giao diện cho DSP cũ vào lúc này.

Nó được hình thành như một thí nghiệm sạch độc lập:

nguồn đơn giản + bộ lọc đơn giản + quỹ đạo thời gian -> kết quả nghe được.

Câu hỏi nghiên cứu chính:

Liệu chúng ta có thể thực sự thủ công, bằng phương pháp thử có kiểm soát và lắng nghe, tìm ra ít nhất một số âm thanh có thể nhận dạng giống giọng nói hay không?

Nói cách khác, nhiệm vụ hiện tại không phải là khả năng tái tạo của VoiceScenario cũ, mà là tìm kiếm mô hình âm học hoạt động tối thiểu nhất.

Tại sao chọn một bộ tổng hợp mới riêng biệt

Nhánh tổng hợp trước đó đã tích lũy rất nhiều thử nghiệm và tham số phụ lẫn nhau. Hiện tại rất khó để hiểu lỗi nằm ở đâu và việc thay đổi một cơ chế có thể dễ dàng làm hỏng cơ chế khác.

Do đó, một bệ thử nghiệm sạch cần thiết như một môi trường được kiểm soát, nơi mỗi cơ chế mới được thêm vào một cách có ý thức và hiệu ứng của nó có thể được nghe thấy riêng biệt.

Nguyên tắc làm việc tiếp theo:

động cơ tối thiểu -> tìm kiếm thủ công -> quan sát -> phát hiện cơ chế còn thiếu -> chỉ thêm cơ chế đó -> lặp lại thí nghiệm.

Kiểm tra thực tế đầu tiên cho thấy gì

Theo tác nhân phát triển (developer agent), tập hợp các tính năng có vẻ đã hoàn thiện, nhưng việc kiểm tra thực tế kết quả cho thấy báo cáo quá lạc quan.

Ở giai đoạn hiện tại:

  • phần lớn các âm thanh/preset đã chuẩn bị thực tế không thể nghe thấy hoặc không mang lại kết quả mong đợi;
  • bản thân báo cáo của tác nhân không thể được coi là bằng chứng về khả năng hoạt động;
  • trong số các hiệu ứng đơn giản dễ nhận biết, hiện tại chủ yếu chỉ nghe thấy âm xì giống như âm S;
  • các âm hoàn chỉnh A, M, R, T và các âm khác chưa thu được thủ công và chưa được xác nhận bằng tai.

Điều này không được coi là thất bại của thí nghiệm. Ngược lại, bệ thử nghiệm giờ đây cho phép tìm hiểu xem những cơ chế nào thực sự là tối thiểu cần thiết cho sự xuất hiện của các lớp âm thanh cụ thể.

Giá trị thực tế hiện tại của phòng thí nghiệm

Giá trị thực tế của trình soạn thảo vẫn chưa được chứng minh một cách dứt khoát.

Hiện tại, một điều cơ bản hơn đang được kiểm tra:

  1. Có mối liên hệ nhân quả nghe thấy được giữa một tham số cụ thể và kết quả không.
  2. Có thể bằng cách di chuyển một hoặc nhiều điểm thủ công để thu được âm thanh thay đổi có thể dự đoán được hay không.
  3. Có thể tìm thấy các lớp âm học ổn định hay không:
    • giống nguyên âm;
    • tiếng ồn / xát (fricative);
    • âm tắc (plosive);
    • âm mũi (nasal);
    • định kỳ / rung;
    • các lớp giống giọng nói khác.
  4. Có thể lưu cấu hình đã tìm thấy như một công thức có thể tái tạo hay không.

Nếu các điểm này được xác nhận, phòng thí nghiệm đã hữu ích như một công cụ nghiên cứu, ngay cả khi chất lượng âm thanh vẫn còn cách xa giọng nói con người.

Kết luận khái niệm quan trọng

Không cần phải xây dựng trước một mô hình sinh lý giọng nói phức tạp.

Hợp lý hơn là trước tiên tìm kiếm các cơ chế âm học tối thiểu bằng tay.

Ví dụ:

  • nếu không thể tạo ra âm R mà không có bộ điều biến định kỳ, điều này sẽ trở thành cơ sở thực nghiệm để thêm cơ chế đó;
  • nếu âm T yêu cầu chuỗi silence -> burst -> noise tail, điều này cũng phải bắt nguồn từ thí nghiệm thủ công;
  • nếu một loại nguyên âm nhất định yêu cầu F0 + F1/F2/F3 ổn định, điều này phải được tìm thấy và xác nhận bằng tai.

Nghĩa là, các tính năng mới được thêm vào không phải theo giả định, mà theo sự thiếu hụt quan sát được của mô hình hiện tại.

Các hạn chế và câu hỏi hiện tại

  1. Cần kiểm tra từng điều khiển hiện tại riêng lẻ và trong các kết hợp tối thiểu.
  2. Cần hiểu loại chuyển đổi nào hiện tại thực sự hữu ích và loại nào vẫn mang tính trang trí.
  3. burst, sine, dao động lặp lại và điều biến tiếng ồn về mặt khái niệm có thể không chỉ là phép nội suy, mà là một lớp bộ điều biến thời gian riêng biệt. Có lẽ sau này nên tách biệt:
    • envelope / keyframes;
    • bộ điều biến nằm trên quỹ đạo cơ bản.
  4. Cần kiểm tra xem các phạm vi vật lý của tham số và trạng thái zero của chúng được tổ chức chính xác đến mức nào.
  5. Cần thêm tính năng lưu thuận tiện các âm thanh và kịch bản thành công khi xuất hiện các kết quả thực sự thú vị.
  6. Biểu đồ phổ (spectrogram) và các phương pháp phân tích kết quả khác có thể cần thiết sau này, nhưng ưu tiên hiện tại là tìm kiếm thủ công bằng thính giác và độ rõ ràng nhân quả của giao diện.

Tiêu chí thành công trước mắt

Không phải là "bộ tổng hợp đã biết nói" và không phải "các preset trùng khớp với các chữ cái".

Tiêu chí thành công trước mắt đơn giản hơn nhiều:

Người dùng có thể bật Loop, di chuyển điểm keyframe hoặc tham số, nghe một vài tùy chọn liên tiếp và tìm kiếm một cách ổn định ít nhất một số âm thanh giống giọng nói có thể nhận dạng được, đồng thời hiểu được thay đổi nào đã dẫn đến chúng.

Sau khi tìm thấy những âm thanh thú vị, kịch bản và logic sẽ được sử dụng để phân tích tiếp theo và để đưa ra quyết định về những cơ chế mới nào thực sự đáng thêm vào.

14.09.2026

Trình chỉnh sửa đa rãnh tương tác để thử nghiệm thủ công với các thông số tổng hợp theo thời gian, nghe lặp lại và tìm kiếm các âm thanh thú vị.