SCOREQによるAI音声評価について
SCOREQとは SCOREQ(スコア・キュー) は、人が聞いたときの音声品質を推定するAI手法です。正式な論文名は SCOREQ(Speech Quality Assessment with Contrastive Regression) 2024年の NeurIPS で発表されました。 公開実装では、録音1本から 推定MOS を出す方法と、基準音声との 距離 を出す方法が用意されています。 どこが新しいのか 従来のMOS推定モデルは、音声を入力して「正解のMOSにできるだけ近い数字を出す」よう学習することが多いです。SCOREQはそれに加え、 品質の異なる音声同士の関係 を学ぶことを重視します。 例えば、聴取評価でAとBの品質が近く、AとCは大きく違うなら、AIが内部で表す音声間の距離もその関係に沿うよう訓練します。この学習方法を論文では**対照回帰(contrastive regression)**と呼んでいます。狙いは、学習時とは異なる種類の音声劣化に対しても、品質の差を捉えやすくすることです。 二つの使い方 モード 入力 出力 FreeDVでの例 NR (参照音声なし) 評価したい録音1本 推定MOS RADEやSSBの受信録音を個別に採点 REF (参照音声あり) 評価したい録音+基準音声 音声表現間の距離 同じ発話の原音とRADE受信録音を比較 注意点は、REFモードの出力はMOSではなく「距離」だということです。 小さいほど基準に近い方向の指標ですが、NRモードの「3.8点」などと数値を直接比較できません。同じ発話のきれいな原音がある場合、開発者は自然音声のREFモードでそれを基準にする使い方を推奨しています。 また、公開モデルには natural (人が録音した声に由来する音声)と synthetic (音声合成など)の区別があります。FreeDVで人の発話を送受信した録音には、開発者の分類ではまず natural が対応します。RADEの受信音がFARGANで合成されるからといって、自動的に synthetic モデルを選ぶわけではありません。これは公開実装の用途説明に基づく判断です。