AI cho mọi ngôn ngữ
RANA Labs huấn luyện mô hình tổng hợp giọng nói và dịch ngôn ngữ cho những thứ tiếng ít dữ liệu, và đang phát triển trợ lý giọng nói. Để ai cũng dùng được AI bằng chính ngôn ngữ mình nói.
Ba công nghệ. Một hệ thống.
Giọng nói và dịch ngôn ngữ đã chạy bằng mô hình chúng tôi tinh chỉnh từ mô hình nền mã nguồn mở. Trợ lý giọng nói đang được phát triển trên chính hai phần này.
Giọng đọc tự nhiên, rõ từng chữ
Mô hình được tinh chỉnh trên bản ghi của người nói thật, học cao độ, nhịp và ngữ điệu, rồi đọc văn bản mới bằng chính chất giọng đó.
- Mạng nơ-ron đầu cuốiChuyển văn bản thành âm thanh trực tiếp, không ghép các đoạn ghi âm có sẵn.
- Nâng lên 48 kHzKhử ồn rồi dùng mô hình siêu phân giải nâng âm thanh lên 48 kHz.
- Chuyển đổi giọng nóiTạo giọng mới chỉ từ vài chục câu ghi âm của người nói.
- Chuẩn hóa văn bảnĐọc số thành chữ, tự thêm dấu câu và ngắt nghỉ theo dấu.
Dịch cả câu, không dịch từng chữ
Mô hình xét toàn bộ câu trước khi dịch, nên giữ đúng ý cả khi hai ngôn ngữ có trật tự từ khác nhau.
- Kiến trúc TransformerCơ chế chú ý đa đầu nối mỗi từ với ngữ cảnh của cả câu.
- Học chuyển giaoTinh chỉnh mô hình nền 10 tỷ tham số đã học hơn 400 ngôn ngữ.
- Kiểm tra bằng dịch ngượcSinh nhiều bản dịch, dịch ngược từng bản rồi chọn bản sát câu gốc nhất.
- Tên riêng và chính tảGiữ nguyên tên người, địa danh và theo đúng chuẩn chữ viết của cộng đồng.
Hỏi bằng giọng nói. Nghe câu trả lời.
Đang phát triển. Trợ lý sẽ nối nhận dạng giọng nói, mô hình ngôn ngữ và hai mô hình giọng nói, dịch ngôn ngữ đã có, để người dùng hỏi và nghe trả lời bằng chính ngôn ngữ của mình.
- Nhận dạng giọng nóiĐang dùng để chép lời bản ghi âm. Bước tiếp theo là nghe hội thoại.
- Mô hình ngôn ngữ lớnHiểu câu hỏi và soạn câu trả lời.
- Dịch ngôn ngữChuyển câu hỏi và câu trả lời giữa các ngôn ngữ.
- Tổng hợp giọng nóiĐọc câu trả lời bằng giọng tự nhiên.
- Nghe
- Hiểu
- Dịch
- Trả lời
- Nói
AI không chỉ dành cho ngôn ngữ lớn
Phần lớn trợ lý AI hiện nay chỉ hỗ trợ tốt những ngôn ngữ có nhiều dữ liệu. Chúng tôi tập trung vào phần còn lại.
Làm được với ít dữ liệu
Quy trình được thiết kế cho những ngôn ngữ có ít văn bản và ít bản ghi âm.
Dùng ngôn ngữ của mình
Đọc, nghe và dịch mà không phải chuyển sang ngôn ngữ khác.
Người bản ngữ kiểm tra
Câu mới và kết quả do AI tạo đều được người bản ngữ duyệt trước khi dùng.
Học nhiều từ ít dữ liệu
Khi không có sẵn dữ liệu lớn, từng câu văn và từng giây ghi âm đều phải được tận dụng. Đây là sáu phương pháp chúng tôi dùng.
- 01
Học chuyển giao
Giọng nói và dịch ngôn ngữ đều bắt đầu từ mô hình nền mã nguồn mở đã học hàng trăm ngôn ngữ, rồi tinh chỉnh cho ngôn ngữ mới.
- 02
Chuyển đổi giọng nói
Tạo dữ liệu cho giọng mới từ vài chục câu ghi âm, thay vì nhiều giờ thu âm.
- 03
Làm sạch âm thanh
Tách nhạc nền, khử ồn và tiếng rè trước khi đưa vào huấn luyện.
- 04
Làm giàu dữ liệu văn bản
Tách câu dài thành câu ngắn, thay tên riêng trong dữ liệu gốc để mô hình không học thuộc tên.
- 05
Huấn luyện trên GPU đám mây
Thuê GPU khi cần, tính với độ chính xác hỗn hợp, tự dừng nếu điểm trên bộ câu kiểm tra không tăng.
- 06
Lượng tử hóa
Mô hình dịch 10 tỷ tham số được nén xuống 8 bit, chạy được trên máy tính thường.
Từ dữ liệu đến sản phẩm
Mỗi mô hình đi qua bốn bước. Người bản ngữ kiểm tra trước khi phát hành.
Thu thập dữ liệu
Văn bản song ngữ có sẵn và bản ghi âm từ cộng đồng, có sự đồng ý của người đóng góp.
Huấn luyện mô hình
Mô hình học phát âm, từ vựng, ngữ pháp và ngữ điệu của từng ngôn ngữ.
Người bản ngữ duyệt
Nghe, đọc và sửa kết quả trước khi phát hành.
Phát hành và cải tiến
Mô hình chạy thật. Phản hồi của người dùng trở thành dữ liệu cho vòng huấn luyện sau.
Đo tự động. Duyệt bởi con người.
Mỗi phiên bản phải đạt các chỉ số kỹ thuật và được người bản ngữ xác nhận trước khi dùng.
Âm thanh đầu ra
Nâng lên 48 kHz bằng mô hình siêu phân giải.
Câu giữ đúng tên riêng
Mô hình dịch trước đó chỉ giữ đúng 2/50.
Kiểm tra mỗi giọng đọc
Máy nghe lại để đo độ rõ chữ, so độ giống giọng, rồi người bản ngữ nghe duyệt.
Kết quả AI được duyệt
Câu do AI dịch chỉ vào dữ liệu huấn luyện sau khi người bản ngữ duyệt.
Có sự đồng ý
Chỉ dùng giọng nói và dữ liệu khi người đóng góp đồng ý.
Bảo mật
Mã hóa kết nối, giới hạn quyền truy cập máy chủ.
Cộng đồng quyết định
Chuẩn chữ viết và cách diễn đạt do cộng đồng chọn, không do chúng tôi áp đặt.
Kết quả AI để riêng
Không trộn vào dữ liệu khi chưa được người bản ngữ duyệt.
Sản phẩm đang được hoàn thiện
Giọng nói và dịch ngôn ngữ đang chạy thử cùng cộng đồng. Trợ lý giọng nói là bước tiếp theo, sau đó mở rộng sang thêm ngôn ngữ.