TREE NEWS thông tin: Xiaomi đã phát hành và mở mã nguồn Xiaomi-CocktailASR-1, một mô hình lớn nhận dạng giọng nói theo người nói mục tiêu ở cấp độ công nghiệp. Mô hình sử dụng kiến trúc LLM đầu-cuối và lấy một đoạn âm thanh tham chiếu của người nói mục tiêu làm gợi ý vân giọng, cho phép nó tách riêng và phiên âm chỉ lời nói của người nói đó trong môi trường có nhiều người nói cùng lúc.
Xiaomi phát hành mô hình nhận dạng giọng nói mã nguồn mở CocktailASR-1
Chia sẻ lên WeChat
Mở WeChat → Quét mã → nhấn "…" để gửi cho bạn bè hoặc Moments.
Nhấn "…" ở góc trên bên phải, chọn "Gửi cho bạn bè" hoặc "Chia sẻ lên Moments".
Tin liên quan
54 phút trước
Sanan Optoelectronics sẽ mở rộng công suất chip quang lên 4.500 tấm/tháng
55 phút trước
Bộ Ngoại giao Trung Quốc bác bỏ báo cáo của công ty AI Mỹ cáo buộc doanh nghiệp Trung Quốc thu thập dữ liệu
1 giờ trước
O-Film cho biết sản phẩm đóng gói nền kính của Zhongke Daojing bắt đầu cung cấp lô nhỏ
1 giờ trước
O-Film cho biết các sản phẩm đóng gói nền kính của Zhongke Daojing đã bước vào giai đoạn cung cấp lô nhỏ
2 giờ trước
Alibaba Cloud nâng cấp Token Plan Personal Edition với 12 công cụ Agent Harness
3 giờ trước
Alipay sẽ ra mắt AI wallet agent và ba công cụ thanh toán AI