TTS自動評価モデルを10の言語学的次元で評価するベンチマーク
arXiv cs.AI ・ 2026-08-10
原題: Beyond Naturalness: Probing Automated Text-To-Speech Evaluators on Linguistically Grounded Dimensions
AI による要約
音声合成の自動評価モデルが言語的な差異を捉えられるか検証するため、10の知覚次元からなる860発話の評価ベンチマークを構築した。4つのMOS予測器と4つのAudio-LLMを検証した結果、前者は音響信号の品質に偏り、後者はプロンプト依存で広範な言語エラーを捕捉できないと判明した。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。