TREE NEWS 情報: Xiaomiは、産業グレードのターゲット話者音声認識大規模モデル「Xiaomi-CocktailASR-1」を公開し、オープンソース化しました。このモデルはエンドツーエンドのLLMアーキテクチャを採用し、ターゲット話者の参照音声クリップを声紋プロンプトとして入力することで、複数人が同時に話す環境でもその話者の発話のみを分離して文字起こしすることができます。
TREE NEWS 情報: Xiaomiは、産業グレードのターゲット話者音声認識大規模モデル「Xiaomi-CocktailASR-1」を公開し、オープンソース化しました。このモデルはエンドツーエンドのLLMアーキテクチャを採用し、ターゲット話者の参照音声クリップを声紋プロンプトとして入力することで、複数人が同時に話す環境でもその話者の発話のみを分離して文字起こしすることができます。