NISQAによるAI音声評価方法について
AIによる疑似MOS音声評価方法には、UTMOSの他に NISQA などがあります。 ここではNISQAv2を取り上げます。NISQAv2は、UTMOSと同じく人が聞いて感じる音声品質をAIで推定する手法です。評価したい音声だけを入力でき、送信前の原音は必要ありません。総合的な品質に加え、雑音、音色の変化、途切れ、音量に関する評価値も出力します。電話やインターネット通話など、通信を通した音声を主な対象として開発されました。 参考: https://deepwiki.com/gabrielmittag/NISQA 参考論文 https://www.isca-archive.org/interspeech_2021/mittag21_interspeech.pdf FreeDVの受信音声を比較する際にも役立つ可能性があります。ただし、出力値は人間によるMOSの実測値ではなく、AIによる予測値です。また、発話内容が正しく伝わったかは、この値だけでは判断できません。 NISQAは Non-Intrusive Speech Quality Assessment の略です。ここでいう「Non-Intrusive」は、品質が劣化した後の音声だけで評価できることを意味します。受信側の録音があれば、原音との波形比較なしで推定できます。 NISQAv2は音声を スペクトログラム に変換し、音の特徴とその時間的な変化を捉えて、音声全体の品質を推定します。モデルの学習には、人間が音声を聞いて付けた品質評価が使われています。 通信音声用モデル nisqa.tar は、次の値を出力します。 総合的な音声品質(推定MOS値)はmos_predです。 いずれも高いほど、その項目の品質が良い方向を示します。たとえば noi_pred が高いことは「雑音が多い」という意味ではありません。 出力名 評価する内容 mos_pred 総合的な音声品質(推定MOS値) noi_pred 雑音に関する品質 col_pred 音色の変化に関する品質 dis_pred 途切れに関する品質 loud_pred 音量に関する品質