Chuyển văn bản thành giọng nói

Văn bản thành giọng đọc tiếng Việt, phát được ngay trong sản phẩm

HiTechCloud cung cấp dịch vụ tổng hợp giọng nói tiếng Việt dưới dạng giao diện lập trình và xử lý theo lô, dùng cho báo nói, thông báo tổng đài, nội dung đào tạo và các ứng dụng cần đọc nội dung cho người dùng nghe.

Hình thức dùng
Giao diện lập trình · Xử lý theo lô
산출물
Tệp âm thanh hoặc luồng phát trực tiếp
인프라
Mô hình phục vụ trên nền tảng của HiTechCloud
데이터 위치
Trung tâm dữ liệu tại Việt Nam do đối tác vận hành
개요

Giọng đọc máy chỉ dùng được khi nó đọc đúng tên riêng và con số

Thử một câu ngắn thì công cụ tổng hợp giọng nói nào cũng nghe được. Vấn đề xuất hiện khi đưa vào nội dung thật: số tiền đọc sai đơn vị, ngày tháng đọc thành dãy số, tên riêng và từ viết tắt bị đọc theo âm tiếng Anh, dấu câu bị bỏ qua nên câu dài không có chỗ ngắt. Người nghe bỏ đi trước khi hết đoạn đầu.

HiTechCloud xử lý phần này ở lớp chuẩn hoá văn bản trước khi tổng hợp: quy tắc đọc số, đơn vị tiền tệ, ngày tháng, từ viết tắt và danh sách tên riêng theo từ điển của chính doanh nghiệp. Đây là phần quyết định chất lượng nghe được, nhiều hơn là việc chọn mô hình nào.

Dịch vụ chạy trên nền tảng phục vụ mô hình Model as a Service và đi qua AI Gateway để kiểm soát khoá truy cập, hạn mức và nhật ký sử dụng. Doanh nghiệp cần hội thoại hai chiều qua điện thoại thì xem AI Voice Agent thay vì trang này. Quý khách có nội dung mẫu muốn nghe thử, liên hệ HiTechCloud.

필요한 이유

Bốn chỗ làm hỏng trải nghiệm nghe

Số và đơn vị bị đọc sai

Số tiền, phần trăm, ngày tháng và số hiệu văn bản cần quy tắc đọc riêng. Không chuẩn hoá trước thì người nghe phải đoán, và với nội dung tài chính hay pháp lý thì đoán sai là rủi ro thật.

Tên riêng và từ viết tắt đọc theo âm sai

Tên sản phẩm, tên địa danh và từ viết tắt của ngành thường bị đọc theo quy tắc chung. Cần từ điển riêng cho từng doanh nghiệp, cập nhật được.

Không có chỗ ngắt nên nghe mệt

Văn bản viết cho mắt đọc khác văn bản cho tai nghe. Câu dài không ngắt, danh sách không có khoảng nghỉ, người nghe mất mạch sau vài câu.

Chi phí tăng theo lượng nội dung mà không ai để ý

Nội dung sinh ra hằng ngày, mỗi lần sửa một chữ lại tổng hợp lại toàn bài. Không có cơ chế bộ nhớ đệm và kiểm soát hạn mức thì chi phí trôi đi lặng lẽ.

서비스 범위

HiTechCloud cung cấp những gì

Giao diện lập trình tổng hợp giọng nói

Gửi văn bản, nhận về tệp âm thanh hoặc luồng phát, dùng trực tiếp trong ứng dụng web, ứng dụng di động hoặc hệ thống nội bộ.

Xử lý theo lô cho khối lượng lớn

Chuyển cả kho bài viết, tài liệu hoặc thông báo thành âm thanh theo lô, phù hợp khi cần bổ sung bản đọc cho nội dung đã có sẵn.

Chuẩn hoá văn bản trước khi đọc

Xây quy tắc đọc số, tiền tệ, ngày tháng, đơn vị đo và từ viết tắt, kèm từ điển tên riêng theo yêu cầu của từng doanh nghiệp.

Điều chỉnh cách đọc theo ngữ cảnh

Cấu hình tốc độ, chỗ ngắt và cách nhấn cho từng loại nội dung, để bản tin, hướng dẫn kỹ thuật và thông báo tổng đài không đọc giống nhau.

Tích hợp vào hệ thống nội dung

Nối vào hệ quản trị nội dung, hệ thống tổng đài hoặc ứng dụng học tập, sinh bản đọc tự động khi nội dung được xuất bản hoặc cập nhật.

Kiểm soát khoá truy cập và hạn mức

Cấp khoá theo ứng dụng, đặt hạn mức và theo dõi mức sử dụng qua AI Gateway, để chi phí luôn nhìn thấy được.

Người dùng nghe bản đọc tự động của bài viết trên điện thoại
Chất lượng nghe

Phần quyết định không nằm ở mô hình, nằm ở văn bản đưa vào mô hình

Cùng một mô hình, cùng một giọng, nhưng bản đọc hay và bản đọc khó nghe khác nhau ở lớp xử lý văn bản phía trước.

  • Từ điển tên riêng và từ viết tắt do doanh nghiệp cung cấp, cập nhật được mà không phải sửa mã nguồn.
  • Quy tắc đọc số tiền, ngày tháng và đơn vị đo được thống nhất bằng văn bản trước khi triển khai.
  • Chỗ ngắt câu và ngắt đoạn được sinh theo cấu trúc nội dung, không chỉ theo dấu câu.
  • Bản đọc được lưu và tái sử dụng khi nội dung không đổi, tránh tổng hợp lại nhiều lần cho cùng một đoạn.
프로세스

Từ nội dung mẫu tới bản đọc chạy tự động

  1. 01

    Nghe thử trên nội dung thật của doanh nghiệp

    Lấy vài đoạn nội dung tiêu biểu, tổng hợp thử và cùng nghe để xác định những chỗ đọc sai cần xử lý.

  2. 02

    Xây quy tắc chuẩn hoá và từ điển riêng

    Thống nhất quy tắc đọc số, đơn vị và ngày tháng; lập danh sách tên riêng, từ viết tắt và cách đọc mong muốn.

  3. 03

    Chọn giọng và cấu hình cách đọc theo loại nội dung

    Gán cấu hình khác nhau cho bản tin, hướng dẫn và thông báo, để mỗi loại nội dung có nhịp đọc phù hợp.

  4. 04

    Tích hợp vào luồng xuất bản

    Nối vào hệ quản trị nội dung hoặc hệ thống nghiệp vụ, sinh bản đọc tự động khi nội dung được xuất bản hoặc cập nhật.

  5. 05

    Theo dõi mức dùng và cập nhật từ điển

    Theo dõi hạn mức qua AI Gateway, bổ sung từ điển khi có tên riêng mới, và soát lại chất lượng theo chu kỳ.

고객

Dịch vụ tổng hợp giọng nói phù hợp với

Cơ quan báo chí và đơn vị sản xuất nội dung

  • Muốn bổ sung bản nghe cho bài viết mà không tăng chi phí thu âm.
  • Lượng bài xuất bản hằng ngày lớn, không thể xử lý thủ công.
  • Cần đọc đúng tên riêng, địa danh và số liệu trong bản tin.

Doanh nghiệp có tổng đài và hệ thống thông báo

  • Thông báo thay đổi thường xuyên nên thu âm lại rất tốn thời gian.
  • Cần sinh nội dung thông báo theo dữ liệu, ví dụ theo từng khách hàng.
  • Muốn giữ một giọng thống nhất trên mọi kênh thông báo.

Đơn vị đào tạo và giáo dục

  • Cần bản đọc cho tài liệu học tập và bài giảng dạng văn bản.
  • Nội dung cập nhật theo học kỳ, thu âm lại không khả thi.
  • Cần hỗ trợ người học có khó khăn khi đọc văn bản dài.

Doanh nghiệp làm sản phẩm số

  • Cần chức năng đọc nội dung ngay trong ứng dụng cho người dùng.
  • Muốn gọi qua giao diện lập trình thay vì dựng hạ tầng mô hình riêng.
  • Cần kiểm soát chi phí theo từng ứng dụng và từng môi trường.
FAQ

자주 묻는 질문

Dịch vụ này khác gì AI Voice Agent?

AI Voice Agent là tác tử hội thoại hai chiều qua điện thoại: nghe, hiểu và trả lời trong thời gian thực. Trang này nói về việc chuyển văn bản thành giọng nói, dùng dưới dạng giao diện lập trình hoặc xử lý theo lô để sinh bản đọc cho nội dung. Hai dịch vụ dùng chung nền tảng mô hình bên dưới.

Có bao nhiêu giọng đọc và chọn giọng thế nào?

Danh sách giọng khả dụng được cung cấp khi khảo sát, vì phụ thuộc vào mô hình đang phục vụ tại thời điểm triển khai. Cách làm thông thường là nghe thử trên chính nội dung của doanh nghiệp rồi chọn, thay vì chọn theo mô tả.

Có tạo được giọng riêng của thương hiệu không?

Việc xây giọng riêng phụ thuộc vào dữ liệu thu âm mà doanh nghiệp có quyền sử dụng và phải có sự đồng ý hợp lệ của người có giọng nói. HiTechCloud đánh giá tính khả thi theo từng trường hợp và nêu rõ điều kiện trước khi nhận, không hứa trước khi xem dữ liệu.

Văn bản gửi lên có bị lưu lại không?

Phạm vi lưu trữ được cấu hình theo yêu cầu của doanh nghiệp và ghi trong thoả thuận. Với nội dung nhạy cảm, hệ thống có thể chỉ giữ bản âm thanh kết quả trong thời hạn cần thiết rồi xoá. Việc gọi mô hình đi qua AI Gateway nên mọi lượt gọi đều có nhật ký.

Đọc được văn bản có lẫn tiếng Anh không?

Có, nhưng chất lượng phụ thuộc vào việc chuẩn hoá. Từ tiếng Anh, tên sản phẩm và từ viết tắt nên được đưa vào từ điển với cách đọc mong muốn, thay vì để mô hình tự quyết định.

비용은 어떻게 산정됩니까?

Chi phí gồm phần triển khai theo phạm vi công việc và phần sử dụng mô hình theo khối lượng nội dung tổng hợp. Bảng giá nền tảng Model as a Service và AI Gateway được công bố trên trang riêng của từng sản phẩm. Giá chưa bao gồm VAT.

Có chạy được trên hạ tầng riêng của doanh nghiệp không?

Có thể, khi doanh nghiệp có yêu cầu giữ toàn bộ nội dung trong mạng nội bộ. Phương án này cần đánh giá về cấu hình máy chủ và chi phí vận hành, nên được xem xét trong bước khảo sát.

Quý khách có nội dung muốn nghe thử trước khi quyết định?

Gửi cho HiTechCloud vài đoạn nội dung tiêu biểu. Chúng tôi sẽ tổng hợp thử, chỉ ra những chỗ cần chuẩn hoá và trao đổi về phương án tích hợp.