Enter로 검색 · ESC로 닫기

AI × Crypto

샤오미, 오픈소스 음성 인식 모델 ‘CocktailASR-1’ 공개

샤오미가 산업용 타깃 화자 음성 인식 대규모 모델인 Xiaomi-CocktailASR-1을 공개하고 오픈소스화했습니다. 이 모델은 엔드투엔드 LLM 아키텍처를 사용하며, 타깃 화자의 참조 오디오 클립을 성문 프롬프트로 입력받아 여러 사람이 동시에 말하는 환경에서도 해당 화자의 발화만을 분리하여 전사할 수 있습니다.

원문

공유

관련 뉴스

TREE NEWS 공유 카드
위 이미지를 길게 눌러 → 사진에 저장 / 공유
보도 요청 의견 보내기