Nhấn Enter để tìm · ESC để đóng

AI × Crypto

Xiaomi phát hành mô hình nhận dạng giọng nói mã nguồn mở CocktailASR-1

Xiaomi đã phát hành và mở mã nguồn Xiaomi-CocktailASR-1, một mô hình lớn nhận dạng giọng nói theo người nói mục tiêu ở cấp độ công nghiệp. Mô hình sử dụng kiến trúc LLM đầu-cuối và lấy một đoạn âm thanh tham chiếu của người nói mục tiêu làm gợi ý vân giọng, cho phép nó tách riêng và phiên âm chỉ lời nói của người nói đó trong môi trường có nhiều người nói cùng lúc.

Bài gốc

Chia sẻ

Tin liên quan

Thẻ chia sẻ TREE NEWS
Nhấn giữ ảnh trên → Lưu vào Ảnh / Chia sẻ
Gửi tin Góp ý