Nhật ký công việc cho nhiệm vụ "Nghiên cứu tổng hợp phần mềm chất lượng cao giọng nói con người trên trình duyệt"

14 сент. 2026 г., 07:31:44

Tiến độ nghiên cứu

Chúng tôi đã kiểm tra giả thuyết rằng đối với bài toán của chúng tôi, nên tồn tại một ví dụ có tính ứng dụng thực tế dạng:

bản ghi âm thanh/âm tiết thực tế → phân tích tự động → quỹ đạo tham số nhỏ gọn của bộ tạo tín hiệu vạn năng → tổng hợp ngược âm thanh có thể nhận dạng

Tại sao một ví dụ như vậy có vẻ tồn tại

  1. Tổng hợp thủ tục (procedural synthesis) tự thân nó đã tồn tại. Web Audio cung cấp bộ dao động, tiếng ồn, bộ lọc và AudioWorklet; Pink Trombone hiển thị đường thanh quản vật lý gốc trên trình duyệt; các bản demo dạng formant cho phép tạo ra các âm giống nguyên âm riêng lẻ từ một số lượng nhỏ tham số.

  2. Biểu diễn dạng sóng (waveform) thông thường rất lớn. Khoảng 1 giây ghi âm từ micro có thể chiếm khoảng 200 KB trong Float32Array. Ngay cả sau khi nén mạnh bằng μ-law @ 8 kHz, nó vẫn còn khoảng 11 KB và hơn 10.000 giá trị mỗi giây, mặc dù giọng nói vẫn được cảm nhận bình thường. Điều này tạo ra trực giác mạnh mẽ rằng cấu trúc âm thanh được cảm nhận phải có một biểu diễn nhỏ gọn hơn đáng kể.

  3. Có rất nhiều phương pháp phân tích giọng nói trong tài liệu. LPC, phân tích nguồn-bộ lọc (source-filter analysis), theo dõi formant, ước lượng phổ bao (spectral-envelope estimation), vocoder, phân tích bằng tổng hợp (analysis-by-synthesis), v.v. Qua tên gọi và mô tả, chúng trông rất gần với cơ chế cần thiết.

  4. LLM ban đầu đánh giá bài toán quá lạc quan. Sơ đồ khái niệm có vẻ đơn giản: generator + parameters + target sound + optimizer. Điều này tạo ra ấn tượng sai lầm rằng việc ánh xạ ngược thực tế (inverse mapping) lẽ ra đã phải được giải quyết từ lâu và có sẵn trong các dự án mã nguồn mở.

Những gì đã tìm thấy

Demo Formant/Web Audio

Có rất nhiều ví dụ trong đó nguồn sawtooth/impulse đi qua một vài bộ lọc thông dải (band-pass filters) để tạo ra âm thanh giống nguyên âm.

Điều này chỉ chứng minh việc tạo trực tiếp từ các tham số đã biết trước. Những ví dụ như vậy không cung cấp cơ chế giải mã ngược mà chúng ta cần.

Pink Trombone / Modular Pink Trombone

Đây là một trong những bộ tạo thú vị nhất được tìm thấy vì:

  • âm thanh được tạo ra theo thủ tục;
  • phần lõi không bắt buộc phải thao tác với các chữ cái;
  • trạng thái thanh quản có thể thay đổi liên tục;
  • mã thực thi hoạt động trong trình duyệt;
  • có thể nhận được các âm trung gian nằm ngoài từ điển cố định.

Nhưng đối với bài toán của chúng tôi, nó thiếu điều quan trọng nhất:

  • không tìm thấy cơ chế recording → tract trajectory;
  • không tự động khôi phục quỹ đạo tham số từ âm A thực tế hoặc bất kỳ âm thanh nào khác;
  • chất lượng của bản tổng hợp vẫn mang tính tổng hợp rõ rệt và không thể hiện giọng nói tự nhiên ngay cả khi điều khiển thủ công.

Nói cách khác, Pink Trombone cung cấp một bộ tạo, chứ không phải bộ giải mã.

Các triển khai kiểu Klatt và Klatt

Không phải là định hướng kiến trúc cho bài toán của chúng tôi.

Lý do:

  • nhiều triển khai đã xây dựng giao diện xung quanh âm vị (phonemes), ARPABET, các cài đặt sẵn (presets) và quy tắc ngôn ngữ;
  • ngôn ngữ và chữ cái trở thành một phần của kiến trúc lõi;
  • các tham số thường được làm thủ công (handcrafted);
  • chất lượng gần giống các bộ tổng hợp cũ;
  • không có ánh xạ ngược vạn năng từ âm thanh bất kỳ sang tham số;
  • không có minh họa về việc tự động khôi phục giọng nói thực tế chất lượng cao.

Đối với chúng tôi, đây là một lớp quá hẹp: chúng tôi đang tìm kiếm cơ chế giải mã âm thanh vạn năng, chứ không phải bảng âm vị.

LPC / Phân tích nguồn-bộ lọc (Source-filter analysis)

Cho phép đánh giá các đặc điểm riêng lẻ: phổ bao, các cộng hưởng, nguồn kích thích, v.v.

Nhưng không tìm thấy trường hợp end-to-end nào mà các đặc điểm này tự động chuyển đổi thành một chương trình điều khiển nhỏ gọn của một bộ tạo đủ vạn năng, sau đó tái tạo ra âm thanh gần giống với bản gốc.

Tức là đây chỉ là các phần riêng lẻ của giải pháp, chứ chưa phải là một hệ thống hoàn chỉnh.

Phân tích bằng tổng hợp (Analysis-by-synthesis)

Đã tìm thấy các công trình nghiên cứu trong đó các tham số của bộ tổng hợp được tinh chỉnh theo giọng nói tự nhiên thông qua tối ưu hóa.

Điều này hữu ích không phải như một giải pháp sẵn có, mà như sự xác nhận về độ phức tạp kỹ thuật: ánh xạ ngược có tính phi tuyến, không rõ ràng và đòi hỏi phải tìm kiếm trong không gian tham số lớn.

Đồng thời, không tìm thấy giải pháp vạn năng thân thiện với trình duyệt nào có chất lượng cần thiết.

TTS thần kinh / Mô hình codec (Neural TTS / codec models)

Chất lượng cao, nhưng đây là một lớp giải pháp khác:

  • biểu diễn bên trong được ẩn bên trong mô hình đã huấn luyện;
  • không có VoiceState vạn năng rõ ràng có thể điều khiển được;
  • không thể sử dụng hệ thống như một bộ tạo vật lý/thủ tục trong suốt (transparent);
  • điều này không đáp ứng mục tiêu nghiên cứu là giải mã âm thanh thành một chương trình điều khiển nhỏ gọn, dễ hiểu.

Những gì không thể tìm thấy

Không tìm thấy bất kỳ ví dụ kỹ thuật mã nguồn mở thuyết phục nào đồng thời thỏa mãn các điều kiện sau:

  1. Lấy bản ghi thực tế của một âm thanh cụ thể hoặc một âm tiết ngắn.
  2. Không yêu cầu phải biết trước chữ cái/âm vị/ngôn ngữ.
  3. Tự động khôi phục quỹ đạo thời gian nhỏ gọn của các tham số.
  4. Sử dụng bộ tạo thủ tục vạn năng thay vì bộ giải mã neural TTS/codec.
  5. Tổng hợp ngược âm thanh với chất lượng ít nhất đủ cho giọng nói bình thường có thể nhận dạng và tốt hơn đáng kể so với các bộ tổng hợp vật lý dạng demo.
  6. Cho phép xem và nghiên cứu việc triển khai giải mã.
  7. Có thể chuyển đổi thực tế sang ngăn xếp trình duyệt (browser stack).

Đây hiện là kết quả âm tính chính của nghiên cứu.

Tại sao bài toán lại phức tạp về mặt kỹ thuật

Bài toán ngược không có duy nhất một nghiệm

Một dạng sóng đầu ra tương tự có thể đạt được bởi các trạng thái bên trong khác nhau của bộ tạo. Không thể chỉ đơn giản khôi phục một cách duy nhất một tập hợp tham số "đúng" từ bản ghi âm.

Cần có thước đo cảm nhận, không chỉ là lỗi dạng sóng (waveform error)

Hai dạng sóng có thể có sự khác biệt lớn giữa các mẫu (sample-by-sample) nhưng nghe gần như giống hệt nhau. Ngược lại, một lỗi nhỏ trong vùng thời gian hoặc phổ quan trọng có thể thay đổi mạnh mẽ cảm nhận.

Điều này có nghĩa là hàm sai số bình phương trung bình (MSE) thông thường không phải là hàm mục tiêu đầy đủ.

Cần tìm quỹ đạo, không phải một véc-tơ

Âm thanh là một quá trình động. Nguồn kích thích, các cộng hưởng, tiếng ồn, độ tấn công (attack), sự đóng mở, kênh mũi và các tham số khác đều thay đổi.

Do đó, biến tìm kiếm thực tế là một chương trình tham số theo thời gian, chứ không phải một điểm tĩnh đơn lẻ.

Bản thân bộ tạo có thể không có khả năng tái tạo âm thanh mong muốn

Nếu mô hình được chọn không đủ biểu cảm, sẽ không có trình tối ưu hóa nào khôi phục được âm thanh gốc. Bộ tạo càng biểu cảm, không gian tham số càng lớn và việc tìm kiếm ngược càng phức tạp.

Giọng nói phức tạp hơn một vài formant

Đối với giọng nói chất lượng cao, các cơ chế như nguồn thanh môn (glottal source), độ nghiêng phổ (spectral tilt), tiếng thở (aspiration), tiếng động hỗn loạn (turbulence), kháng cộng hưởng (antiresonances), sự ghép nối qua mũi (nasal coupling), độ rung/rẩy (jitter/shimmer), động lực học thanh quản, tương tác nguồn-bộ lọc và các cơ chế khác có thể rất quan trọng.

Việc bổ sung từng cơ chế giúp cải thiện tính biểu cảm nhưng đồng thời làm phức tạp thêm quá trình giải mã.

Tinh chỉnh thủ công không thể mở rộng quy mô

Việc tự chỉnh sửa tham số của một chữ A thủ công là có thể thực hiện được. Việc khôi phục vạn năng một âm thanh bất kỳ bằng phương pháp này là bất khả thi.

Điều này giống như việc chọn thủ công một màu chính xác thông qua CMYK mà không cần chuyển đổi từ màu mục tiêu sang tham số: bạn có thể đạt được một vài ví dụ riêng lẻ, nhưng nó không giải quyết được bài toán tổng quát.

Phát biểu lại vấn đề cốt lõi một cách chính xác hơn

Nhiệm vụ chính giờ đây không được định nghĩa là "tạo ra bộ tổng hợp các chữ cái tiếng Nga" hay "chọn các cài đặt sẵn tốt".

Nó mang tính vạn năng hơn:

Học cách tự động tìm kiếm một chương trình tham số thời gian nhỏ gọn cho một bộ tạo đủ vạn năng đối với một âm thanh thực tế cho trước.

Chữ cái, âm vị và ngôn ngữ chỉ nên là các danh mục khả dĩ nằm trên không gian âm thanh đã tìm thấy, chứ không phải là một phần của phần lõi.

Meta-kết luận về việc làm việc với LLM

Trường hợp này cho thấy một rủi ro cụ thể: LLM dễ dàng nhầm lẫn sự phân rã kiến trúc rõ ràng với độ phức tạp kỹ thuật thấp.

Một số mô hình ban đầu mô tả bài toán là đơn giản về mặt thực tế vì tất cả các thành phần đều quen thuộc khi xét riêng lẻ: Web Audio, bộ lọc, phép nội suy, tối ưu hóa.

Nhưng sự hiện diện của các thành phần dễ hiểu không chứng minh sự tồn tại của một hệ thống hoạt động được tạo từ chúng.

Chỉ khi cố gắng tìm kiếm một trường hợp end-to-end có thể tái tạo cụ thể mới cho thấy rằng ánh xạ ngược quan trọng trong số các giải pháp được tìm thấy thực sự không tồn tại.

Để tiếp tục công việc, tính khả thi về mặt kỹ thuật cần phải được kiểm chứng thông qua các thí nghiệm chứng minh tính khả thi (proof-of-feasibility) tối thiểu thay vì dựa vào sự tự tin của LLM.

13.09.2026

Tìm kiếm và nghiên cứu các dự án trên trình duyệt và các phương pháp DSP có thể tái tạo ít nhất một vài âm tiết hoặc âm thanh giọng nói của con người với chất lượng cao theo cách lập trình, không dùng TTS tạo sinh và không gắn kết phần nhân với chữ cái/âm tiết.