TREE NEWS thông tin: Xiaomi đã phát hành và mở mã nguồn Xiaomi-CocktailASR-1, một mô hình lớn nhận dạng giọng nói theo người nói mục tiêu ở cấp độ công nghiệp. Mô hình sử dụng kiến trúc LLM đầu-cuối và lấy một đoạn âm thanh tham chiếu của người nói mục tiêu làm gợi ý vân giọng, cho phép nó tách riêng và phiên âm chỉ lời nói của người nói đó trong môi trường có nhiều người nói cùng lúc.
Xiaomi phát hành mô hình nhận dạng giọng nói mã nguồn mở CocktailASR-1
Chia sẻ lên WeChat
Mở WeChat → Quét mã → nhấn "…" để gửi cho bạn bè hoặc Moments.
Nhấn "…" ở góc trên bên phải, chọn "Gửi cho bạn bè" hoặc "Chia sẻ lên Moments".
Tin liên quan
8 phút trước
O-Film cho biết sản phẩm đóng gói nền kính của Zhongke Daojing bắt đầu cung cấp lô nhỏ
8 phút trước
O-Film cho biết các sản phẩm đóng gói nền kính của Zhongke Daojing đã bước vào giai đoạn cung cấp lô nhỏ
1 giờ trước
Alibaba Cloud nâng cấp Token Plan Personal Edition với 12 công cụ Agent Harness
2 giờ trước
Alipay sẽ ra mắt AI wallet agent và ba công cụ thanh toán AI
2 giờ trước
Genspark ra mắt Gen-1 Slides, mô hình PPT được huấn luyện hậu kỳ trên MiniMax M3
4 giờ trước
Trump nói ông không lo ngại AI sẽ gây ra sự tuyệt chủng của loài người