Giọng nói · Dịch ngôn ngữ · Trợ lý AI

AI cho mọi ngôn ngữ

RANA Labs huấn luyện mô hình tổng hợp giọng nói và dịch ngôn ngữ cho những thứ tiếng ít dữ liệu, và đang phát triển trợ lý giọng nói. Để ai cũng dùng được AI bằng chính ngôn ngữ mình nói.

01Công nghệ

Ba công nghệ. Một hệ thống.

Giọng nói và dịch ngôn ngữ đã chạy bằng mô hình chúng tôi tinh chỉnh từ mô hình nền mã nguồn mở. Trợ lý giọng nói đang được phát triển trên chính hai phần này.

Giọng đọc tự nhiên, rõ từng chữ

Mô hình được tinh chỉnh trên bản ghi của người nói thật, học cao độ, nhịp và ngữ điệu, rồi đọc văn bản mới bằng chính chất giọng đó.

  • Mạng nơ-ron đầu cuốiChuyển văn bản thành âm thanh trực tiếp, không ghép các đoạn ghi âm có sẵn.
  • Nâng lên 48 kHzKhử ồn rồi dùng mô hình siêu phân giải nâng âm thanh lên 48 kHz.
  • Chuyển đổi giọng nóiTạo giọng mới chỉ từ vài chục câu ghi âm của người nói.
  • Chuẩn hóa văn bảnĐọc số thành chữ, tự thêm dấu câu và ngắt nghỉ theo dấu.
Tổng hợp giọng nóiĐang đọc
Giọng tổng hợpTự nhiên · 48 kHz
1.0×

0:00Văn bảnChuẩn hóaSóng âm48 kHz0:00

Dịch cả câu, không dịch từng chữ

Mô hình xét toàn bộ câu trước khi dịch, nên giữ đúng ý cả khi hai ngôn ngữ có trật tự từ khác nhau.

  • Kiến trúc TransformerCơ chế chú ý đa đầu nối mỗi từ với ngữ cảnh của cả câu.
  • Học chuyển giaoTinh chỉnh mô hình nền 10 tỷ tham số đã học hơn 400 ngôn ngữ.
  • Kiểm tra bằng dịch ngượcSinh nhiều bản dịch, dịch ngược từng bản rồi chọn bản sát câu gốc nhất.
  • Tên riêng và chính tảGiữ nguyên tên người, địa danh và theo đúng chuẩn chữ viết của cộng đồng.
Dịch ngôn ngữ · Cơ chế chú ýĐang dịch
Câu gốcMã hóa
Bản dịchGiải mã

Hỏi bằng giọng nói. Nghe câu trả lời.

Đang phát triển. Trợ lý sẽ nối nhận dạng giọng nói, mô hình ngôn ngữ và hai mô hình giọng nói, dịch ngôn ngữ đã có, để người dùng hỏi và nghe trả lời bằng chính ngôn ngữ của mình.

  • Nhận dạng giọng nóiĐang dùng để chép lời bản ghi âm. Bước tiếp theo là nghe hội thoại.
  • Mô hình ngôn ngữ lớnHiểu câu hỏi và soạn câu trả lời.
  • Dịch ngôn ngữChuyển câu hỏi và câu trả lời giữa các ngôn ngữ.
  • Tổng hợp giọng nóiĐọc câu trả lời bằng giọng tự nhiên.
Trợ lý · Mô phỏngSẵn sàng

  1. Nghe
  2. Hiểu
  3. Dịch
  4. Trả lời
  5. Nói
02Định hướng

AI không chỉ dành cho ngôn ngữ lớn

Phần lớn trợ lý AI hiện nay chỉ hỗ trợ tốt những ngôn ngữ có nhiều dữ liệu. Chúng tôi tập trung vào phần còn lại.

01

Làm được với ít dữ liệu

Quy trình được thiết kế cho những ngôn ngữ có ít văn bản và ít bản ghi âm.

02

Dùng ngôn ngữ của mình

Đọc, nghe và dịch mà không phải chuyển sang ngôn ngữ khác.

03

Người bản ngữ kiểm tra

Câu mới và kết quả do AI tạo đều được người bản ngữ duyệt trước khi dùng.

03Huấn luyện

Học nhiều từ ít dữ liệu

Khi không có sẵn dữ liệu lớn, từng câu văn và từng giây ghi âm đều phải được tận dụng. Đây là sáu phương pháp chúng tôi dùng.

0tỷ tham số · mô hình dịch
Khởi đầuSai số giảm qua từng vòng
Tập huấn luyệnTập kiểm định độc lập
  1. 01

    Học chuyển giao

    Giọng nói và dịch ngôn ngữ đều bắt đầu từ mô hình nền mã nguồn mở đã học hàng trăm ngôn ngữ, rồi tinh chỉnh cho ngôn ngữ mới.

  2. 02

    Chuyển đổi giọng nói

    Tạo dữ liệu cho giọng mới từ vài chục câu ghi âm, thay vì nhiều giờ thu âm.

  3. 03

    Làm sạch âm thanh

    Tách nhạc nền, khử ồn và tiếng rè trước khi đưa vào huấn luyện.

  4. 04

    Làm giàu dữ liệu văn bản

    Tách câu dài thành câu ngắn, thay tên riêng trong dữ liệu gốc để mô hình không học thuộc tên.

  5. 05

    Huấn luyện trên GPU đám mây

    Thuê GPU khi cần, tính với độ chính xác hỗn hợp, tự dừng nếu điểm trên bộ câu kiểm tra không tăng.

  6. 06

    Lượng tử hóa

    Mô hình dịch 10 tỷ tham số được nén xuống 8 bit, chạy được trên máy tính thường.

04Quy trình

Từ dữ liệu đến sản phẩm

Mỗi mô hình đi qua bốn bước. Người bản ngữ kiểm tra trước khi phát hành.

BƯỚC 1

Thu thập dữ liệu

Văn bản song ngữ có sẵn và bản ghi âm từ cộng đồng, có sự đồng ý của người đóng góp.

BƯỚC 2

Huấn luyện mô hình

Mô hình học phát âm, từ vựng, ngữ pháp và ngữ điệu của từng ngôn ngữ.

BƯỚC 3

Người bản ngữ duyệt

Nghe, đọc và sửa kết quả trước khi phát hành.

BƯỚC 4

Phát hành và cải tiến

Mô hình chạy thật. Phản hồi của người dùng trở thành dữ liệu cho vòng huấn luyện sau.

05Chất lượng

Đo tự động. Duyệt bởi con người.

Mỗi phiên bản phải đạt các chỉ số kỹ thuật và được người bản ngữ xác nhận trước khi dùng.

0kHz

Âm thanh đầu ra

Nâng lên 48 kHz bằng mô hình siêu phân giải.

0/50

Câu giữ đúng tên riêng

Mô hình dịch trước đó chỉ giữ đúng 2/50.

0bước

Kiểm tra mỗi giọng đọc

Máy nghe lại để đo độ rõ chữ, so độ giống giọng, rồi người bản ngữ nghe duyệt.

0%

Kết quả AI được duyệt

Câu do AI dịch chỉ vào dữ liệu huấn luyện sau khi người bản ngữ duyệt.

Phương pháp đánh giá chrF++Bộ câu đời thường độc lậpBộ câu tên riêngKiểm tra dịch ngượcMáy nghe lại (độ rõ chữ)Độ giống giọng

Có sự đồng ý

Chỉ dùng giọng nói và dữ liệu khi người đóng góp đồng ý.

Bảo mật

Mã hóa kết nối, giới hạn quyền truy cập máy chủ.

Cộng đồng quyết định

Chuẩn chữ viết và cách diễn đạt do cộng đồng chọn, không do chúng tôi áp đặt.

Kết quả AI để riêng

Không trộn vào dữ liệu khi chưa được người bản ngữ duyệt.

06Sắp ra mắt

Sản phẩm đang được hoàn thiện

Giọng nói và dịch ngôn ngữ đang chạy thử cùng cộng đồng. Trợ lý giọng nói là bước tiếp theo, sau đó mở rộng sang thêm ngôn ngữ.

Tổng hợp giọng nói Dịch ngôn ngữ Trợ lý giọng nói Thêm ngôn ngữ mới