TREE NEWS 소식: 샤오미가 산업용 타깃 화자 음성 인식 대규모 모델인 Xiaomi-CocktailASR-1을 공개하고 오픈소스화했습니다. 이 모델은 엔드투엔드 LLM 아키텍처를 사용하며, 타깃 화자의 참조 오디오 클립을 성문 프롬프트로 입력받아 여러 사람이 동시에 말하는 환경에서도 해당 화자의 발화만을 분리하여 전사할 수 있습니다.
샤오미, 오픈소스 음성 인식 모델 ‘CocktailASR-1’ 공개
관련 뉴스
4분 전
오필름, 중커다오징 유리기판 패키징 제품 소량 공급 시작
4분 전
O-Film, 중커다오징의 글라스 기판 패키징 제품이 소량 공급 단계에 진입했다고 밝혀
1시간 전
알리바바 클라우드, Token Plan Personal Edition 업그레이드—12개 Agent Harness 도구 추가
2시간 전
알리페이, AI 월렛 에이전트와 3가지 AI 결제 도구 출시 예정
2시간 전
Genspark, MiniMax M3를 사후 학습한 PPT 모델 ‘Gen-1 Slides’ 출시
3시간 전
트럼프, AI가 인류 멸종 초래할까 걱정하지 않는다고 밝혀