NISQAによるAI音声評価方法について
AIによる疑似MOS音声評価方法には、UTMOSの他にNISQAなどがあります。
ここではNISQAv2を取り上げます。NISQAv2は、UTMOSと同じく人が聞いて感じる音声品質をAIで推定する手法です。評価したい音声だけを入力でき、送信前の原音は必要ありません。総合的な品質に加え、雑音、音色の変化、途切れ、音量に関する評価値も出力します。電話やインターネット通話など、通信を通した音声を主な対象として開発されました。
参考: https://deepwiki.com/gabrielmittag/NISQA
参考論文 https://www.isca-archive.org/interspeech_2021/mittag21_interspeech.pdf
FreeDVの受信音声を比較する際にも役立つ可能性があります。ただし、出力値は人間によるMOSの実測値ではなく、AIによる予測値です。また、発話内容が正しく伝わったかは、この値だけでは判断できません。
NISQAは Non-Intrusive Speech Quality Assessment の略です。ここでいう「Non-Intrusive」は、品質が劣化した後の音声だけで評価できることを意味します。受信側の録音があれば、原音との波形比較なしで推定できます。
NISQAv2は音声をスペクトログラムに変換し、音の特徴とその時間的な変化を捉えて、音声全体の品質を推定します。モデルの学習には、人間が音声を聞いて付けた品質評価が使われています。
通信音声用モデル nisqa.tar は、次の値を出力します。
総合的な音声品質(推定MOS値)はmos_predです。
いずれも高いほど、その項目の品質が良い方向を示します。たとえば noi_pred が高いことは「雑音が多い」という意味ではありません。
出力名 評価する内容
mos_pred 総合的な音声品質(推定MOS値)
noi_pred 雑音に関する品質
col_pred 音色の変化に関する品質
dis_pred 途切れに関する品質
loud_pred 音量に関する品質
コメント
コメントを投稿