トレンド一覧

TTS自動評価モデルを10の言語学的次元で評価するベンチマーク

arXiv cs.AI ・ 2026-08-10

原題: Beyond Naturalness: Probing Automated Text-To-Speech Evaluators on Linguistically Grounded Dimensions

AI による要約

音声合成の自動評価モデルが言語的な差異を捉えられるか検証するため、10の知覚次元からなる860発話の評価ベンチマークを構築した。4つのMOS予測器と4つのAudio-LLMを検証した結果、前者は音響信号の品質に偏り、後者はプロンプト依存で広範な言語エラーを捕捉できないと判明した。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。

音声・音楽 / 研究・論文

この話題のこれまで

音声合成技術は小型化と性能向上が並行して進み、2026年7月にはローカルで動作する極小モデル「Inflect v2」がリリースされ、8月には感情制御やクロスリンガル音声変換を可能にするaudio.cpp 0.5が登場した。同時にアリババが音声合成ランキング1位となった「Qwen-Audio-3.0-TTS」を発表し、日本語対応や音声クローン機能を備えた高度なモデルが注目を集めた。こうした動きの中で、8月にはTTSの自動評価に関する課題が浮き彫りになり、10の言語学的次元で評価するベンチマークが構築された。

  1. 4Mおよび10M未満の極小サイズで動作する完全な音声合成モデル「Inflect v2」 2026-07-25 ・ r/LocalLLaMA
  2. 音声合成ランキングで1位を獲得したAI「Qwen-Audio-3.0-TTS」をアリババが公開。日本語対応、音声クローンも可能(生成AIクローズアップ) - au Webポータル 2026-07-27 ・ Google News (音声・音楽AI)
  3. audio.cpp 0.5リリース、感情制御できる音声生成モデルなどを追加 2026-08-01 ・ r/LocalLLaMA
  4. 声を一回設計し複製し続けるTTS運用でAIナレーターの音声変動を解決 2026-08-03 ・ Zenn AI

当サイトが集めた記事から、同じ話題のものを古い順に並べています。

この話題に関わるコラム