Nhật ký công việc cho nhiệm vụ "Phát triển pipeline phát âm tiếng Việt riêng và từ điển âm thanh"

20 сент. 2026 г., 01:20:00

Tổng kết trung gian về TTS và lồng tiếng địa phương tiếng Việt

Công việc liên quan đến nhiệm vụ «Phát triển đường ống lồng tiếng tiếng Việt và từ điển âm thanh của riêng mình».

Vấn đề ban đầu

Ban đầu, chúng tôi xem xét speechSynthesis trên trình duyệt và sau đó là tạo âm thanh qua OpenRouter + Google Gemini.

speechSynthesis trên trình duyệt tỏ ra không phù hợp làm cơ chế cơ bản cho khóa học tiếng Việt: việc cài đặt giọng đọc không rõ ràng, phụ thuộc vào trình duyệt/ nhà cung cấp cụ thể, có thể bị treo ở trạng thái Downloading voices ..., và không thể yêu cầu người dùng tự cài đặt giọng ngôn ngữ thủ công.

Tiếp theo, một đường ống TTS đã được triển khai thông qua OpenRouter. Nhìn chung, nó hoạt động tốt với văn bản thông thường, nhưng gặp phải một hạn chế nghiêm trọng đối với đầu vào tối thiểu: khi cố gắng phát âm một chữ cái đơn lẻ, OpenRouter/Gemini trả về lỗi HTTP 400 hoặc không đưa ra kết quả sử dụng được. Đối với TTS thông thường, điều này có thể được chấp nhận, nhưng đối với sách vỡ lòng (bảng chữ cái), đây là một vấn đề mang tính chặn (blocking), bởi vì chúng ta cần các chữ cái riêng lẻ, các chữ tượng hình/grapheme, các âm tiết ngắn và các đơn vị ngữ âm tối thiểu.

Do đó, một nhánh kỹ thuật riêng biệt đã được tách ra: «Nghiên cứu và triển khai lồng tiếng TTS cục bộ thông qua máy chủ nội bộ».


Chuyển sang tạo âm thanh cục bộ

Dự án VieNeu-TTS đã được thiết lập cục bộ trong Docker.

Hiện tại, chúng tôi đang sử dụng phiên bản 2, phiên bản đã từng được thử nghiệm trước đó; ngoài ra còn có phiên bản 3 mới hơn.

Kết quả thực tế quan trọng: VieNeu-TTS có khả năng phát âm các chữ cái/grapheme tiếng Việt đơn lẻ một cách ổn định và rõ ràng. Đây là điểm khác biệt cơ bản so với đường ống Gemini hiện tại.

Tại sao điều này lại quan trọng đối với sách vỡ lòng

Đối với tiếng Việt, chúng ta không chỉ cần một "trình đọc văn bản" vạn năng, mà cần một trình tạo các đơn vị học tập tối thiểu:

  • các nguyên âm đơn;
  • các grapheme riêng lẻ đi kèm dấu thanh;
  • các âm tiết ngắn;
  • nguyên âm đôi / nguyên âm ba;
  • các đối lập tối thiểu;
  • các từ đơn lẻ;
  • sau đó mới đến các cụm từ ngắn.

Nghĩa là, TTS phải hỗ trợ các truy vấn có mục tiêu dạng: "hãy phát âm đúng grapheme/âm tiết này", thay vì yêu cầu ngữ cảnh của cả câu.

Ở tiêu chí này, VieNeu-TTS đã cho thấy những ưu thế đáng kể.

Cơ sở lý thuyết về các đơn vị cụ thể cần phải phát âm được ghi nhận trong các khái niệm:

Ví dụ: 18 dạng của nhóm A

Đối với dạng Latin cơ bản a trong tiếng Việt, có ba nguyên âm khác nhau:

  • a;
  • ă;
  • â.

Mỗi nguyên âm này có thể mang một trong sáu thanh điệu, tạo ra 18 hình thái chữ viết:

  • a á à ả ã ạ;
  • ă ắ ằ ẳ ẵ ặ;
  • â ấ ầ ẩ ẫ ậ.

VieNeu-TTS có khả năng phát âm riêng biệt từng đơn vị tối thiểu như vậy.

Đối với khóa học, điều này mang lại một cấu trúc tự nhiên:

grapheme → tệp âm thanh đã lưu.

Sau khi tạo, mỗi biến thể có thể được lưu vào kho lưu trữ tệp và tái sử dụng mà không cần gọi lại TTS ở mỗi lần phát lại.

Giá trị âm học của tập dữ liệu tổng hợp

Biểu đồ phổ (spectrogram) của tập dữ liệu đã tạo cho thấy các phát âm đơn lẻ được phân tách rõ ràng và có cấu trúc nội tại dễ nhận biết.

Để phân tích sâu hơn, việc xem xét 18 biến thể không phải như 18 lớp hoàn toàn độc lập, mà là sự kết hợp của hai yếu tố sẽ rất hữu ích:

  1. chất lượng nguyên âm: a / ă / â;
  2. thanh điệu: ngang / sắc / huyền / hỏi / ngã / nặng.

Về mặt lý thuyết, điều này cho phép phân tích các đặc điểm một cách riêng biệt:

  • F1/F2 và độ dài → nguyên âm nào;
  • Đường bao F0, độ dài, năng lượng, voicing và các đặc điểm cấu âm (phonation) → thanh điệu nào;
  • sau đó kết hợp kết quả thành một grapheme cụ thể.

Điều này có thể hữu ích không chỉ cho việc tạo âm thanh, mà còn làm cơ sở cho ground truth tổng hợp phục vụ các thí nghiệm trong tương lai về chủ đề "âm thanh → đặc điểm ngữ âm/grapheme".

Tại sao VieNeu-TTS có vẻ đầy hứa hẹn

Dự án được chuyên môn hóa dành riêng cho tiếng Việt, được phát triển tại Việt Nam và được huấn luyện trên một khối lượng lớn dữ liệu tiếng Việt. Theo thông tin có sẵn, phiên bản 2 đã sử dụng hơn 10.000 giờ ghi âm tiếng Việt.

Điều này không loại bỏ việc kiểm định (validation), nhưng làm cho mô hình trở nên phù hợp hơn rất nhiều với nhiệm vụ của chúng ta so với một TTS đa ngôn ngữ tổng quát.

Kiểm định chất lượng

Chất lượng cuối cùng của các âm thanh và thanh điệu đơn lẻ sẽ được kiểm tra với người bản xứ.

Những yếu tố cần kiểm tra trước tiên:

  • tính dễ phân biệt của các thanh điệu;
  • sự chính xác của cặp hỏi/ngã;
  • độ ngắn của ă/â;
  • tính tự nhiên của các chữ cái/âm tiết đơn lẻ ngoài ngữ cảnh;
  • giọng địa phương (accent);
  • sự vắng mặt của các hiện tượng nhiễu/tạp âm (artifacts) ở các đầu vào rất ngắn.

Do đó, kiến trúc tin cậy hiện được hình dung như sau:

VieNeu-TTS = trình tạo ứng viên cục bộ chính

người bản xứ = người kiểm định chất lượng

** cơ sở dữ liệu của chúng ta = lưu trữ các bản ghi âm đã được xác nhận/chấp nhận**

Các yêu cầu đối với phần này của hệ thống cũng được tổng hợp trong khái niệm «Lồng tiếng và lớp âm thanh của khóa học tiếng Việt».

Kiến trúc lưu trữ

Không cần phải tạo lại âm thanh mỗi lần.

Đối với mỗi đơn vị học tập, cần lưu trữ:

  • văn bản/grapheme/âm tiết;
  • loại đơn vị;
  • tệp âm thanh;
  • công cụ và phiên bản mô hình;
  • tham số tạo âm thanh;
  • biến thể phát âm / phương ngữ nếu cần;
  • trạng thái kiểm tra;
  • khả năng tạo lại (regenerate);
  • khả năng thay thế bản ghi tổng hợp bằng bản ghi thực tế của người bản xứ.

Các trạng thái được thiết kế hợp lý theo hướng:

  • generated (đã tạo);
  • needs_review (cần xem xét lại);
  • approved (đã phê duyệt);
  • rejected (đã từ chối).

Kết luận thực tế hiện tại

Đối với Vietnamguru, VieNeu-TTS cục bộ hiện trông phù hợp hơn rất nhiều làm cơ chế cơ bản cho sách vỡ lòng so với Google Gemini qua OpenRouter, bởi vì nó hoạt động ổn định trên các đầu vào tối thiểu và biết cách phát âm các chữ cái/grapheme đơn lẻ.

Ngay cả khi sau này một công cụ khác tỏ ra chất lượng hơn đối với các đoạn văn bản dài, khả năng tổng hợp đáng tin cậy các đơn vị tối thiểu vẫn là một tiêu chí quan trọng hàng đầu cho dự án của chúng ta.

Toàn bộ khung phương pháp luận của dự án được tập hợp trong khái niệm «Tiếng Việt: hệ thống và phương pháp học tập», trong khi việc phát triển khóa học thực tế đang được tiến hành trong nhiệm vụ «Phát triển hệ thống học tiếng Việt cho đối tượng người lớn».

19.09.2026

Loại bỏ sự phụ thuộc vào speechSynthesis của trình duyệt đối với tiếng Việt và triển khai việc tạo, kiểm tra, lưu trữ bản ghi âm được quản lý thông qua OpenRouter + Google Gemini.