SCOREQによるAI音声評価について

 SCOREQとは

SCOREQ(スコア・キュー)は、人が聞いたときの音声品質を推定するAI手法です。正式な論文名は SCOREQ(Speech Quality Assessment with Contrastive Regression)
2024年のNeurIPSで発表されました。
公開実装では、録音1本から
推定MOS
を出す方法と、基準音声との距離を出す方法が用意されています。

どこが新しいのか

従来のMOS推定モデルは、音声を入力して「正解のMOSにできるだけ近い数字を出す」よう学習することが多いです。SCOREQはそれに加え、品質の異なる音声同士の関係を学ぶことを重視します。

例えば、聴取評価でAとBの品質が近く、AとCは大きく違うなら、AIが内部で表す音声間の距離もその関係に沿うよう訓練します。この学習方法を論文では**対照回帰(contrastive regression)**と呼んでいます。狙いは、学習時とは異なる種類の音声劣化に対しても、品質の差を捉えやすくすることです。

二つの使い方

モード入力出力FreeDVでの例
NR(参照音声なし)評価したい録音1本推定MOSRADEやSSBの受信録音を個別に採点
REF(参照音声あり)評価したい録音+基準音声音声表現間の距離同じ発話の原音とRADE受信録音を比較

注意点は、REFモードの出力はMOSではなく「距離」だということです。 小さいほど基準に近い方向の指標ですが、NRモードの「3.8点」などと数値を直接比較できません。同じ発話のきれいな原音がある場合、開発者は自然音声のREFモードでそれを基準にする使い方を推奨しています。

また、公開モデルにはnatural(人が録音した声に由来する音声)とsynthetic(音声合成など)の区別があります。FreeDVで人の発話を送受信した録音には、開発者の分類ではまず natural が対応します。RADEの受信音がFARGANで合成されるからといって、自動的に synthetic モデルを選ぶわけではありません。これは公開実装の用途説明に基づく判断です。

コメント

このブログの人気の投稿

WSJT-X Improved v2.8.0がリリースされました!

WWAコンテストって?