SCOREQによるAI音声評価について
- リンクを取得
- ×
- メール
- 他のアプリ
SCOREQとは
SCOREQ(スコア・キュー)は、人が聞いたときの音声品質を推定するAI手法です。正式な論文名は SCOREQ(Speech Quality Assessment with Contrastive Regression)
2024年のNeurIPSで発表されました。
公開実装では、録音1本から推定MOSを出す方法と、基準音声との距離を出す方法が用意されています。
どこが新しいのか
従来のMOS推定モデルは、音声を入力して「正解のMOSにできるだけ近い数字を出す」よう学習することが多いです。SCOREQはそれに加え、品質の異なる音声同士の関係を学ぶことを重視します。
例えば、聴取評価でAとBの品質が近く、AとCは大きく違うなら、AIが内部で表す音声間の距離もその関係に沿うよう訓練します。この学習方法を論文では**対照回帰(contrastive regression)**と呼んでいます。狙いは、学習時とは異なる種類の音声劣化に対しても、品質の差を捉えやすくすることです。
二つの使い方
| モード | 入力 | 出力 | FreeDVでの例 |
|---|---|---|---|
| NR(参照音声なし) | 評価したい録音1本 | 推定MOS | RADEやSSBの受信録音を個別に採点 |
| REF(参照音声あり) | 評価したい録音+基準音声 | 音声表現間の距離 | 同じ発話の原音とRADE受信録音を比較 |
注意点は、REFモードの出力はMOSではなく「距離」だということです。 小さいほど基準に近い方向の指標ですが、NRモードの「3.8点」などと数値を直接比較できません。同じ発話のきれいな原音がある場合、開発者は自然音声のREFモードでそれを基準にする使い方を推奨しています。
また、公開モデルにはnatural(人が録音した声に由来する音声)とsynthetic(音声合成など)の区別があります。FreeDVで人の発話を送受信した録音には、開発者の分類ではまず natural が対応します。RADEの受信音がFARGANで合成されるからといって、自動的に synthetic モデルを選ぶわけではありません。これは公開実装の用途説明に基づく判断です。
- リンクを取得
- ×
- メール
- 他のアプリ
コメント
コメントを投稿