テキストと音声とアバター動画を統合生成するEx-Omni-2D
arXiv cs.CL ・ 2026-08-11
原題: Ex-Omni-2D: Expressive Omni-Modal Dialogue Models with Native Visual Presence
AI による要約
多モーダルな入力に対してテキスト応答とパーソナライズされた音声、および同期されたアバター動画を同時に生成する対話フレームワーク「Ex-Omni-2D」が発表された。モデルがシーンや感情を描写する「Visual Thought Plan」と音声ユニットを統合予測し、それをアバター動画のフレームとリアルタイムに位置合わせする仕組みを持つ。大規模な4者(問い合わせ・テキスト・音声・動画)ペアデータなしで学習可能である。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。