Enterで検索 · ESCで閉じる

AI × Crypto

Xiaomi、オープンソースの音声認識モデル「CocktailASR-1」を公開

Xiaomiは、産業グレードのターゲット話者音声認識大規模モデル「Xiaomi-CocktailASR-1」を公開し、オープンソース化しました。このモデルはエンドツーエンドのLLMアーキテクチャを採用し、ターゲット話者の参照音声クリップを声紋プロンプトとして入力することで、複数人が同時に話す環境でもその話者の発話のみを分離して文字起こしすることができます。

原文

シェア

関連ニュース

TREE NEWS シェアカード
上の画像を長押し → 写真に保存 / シェア
取材依頼 ご意見