トレンド一覧

テキストと音声とアバター動画を統合生成するEx-Omni-2D

arXiv cs.CL ・ 2026-08-11

原題: Ex-Omni-2D: Expressive Omni-Modal Dialogue Models with Native Visual Presence

AI による要約

多モーダルな入力に対してテキスト応答とパーソナライズされた音声、および同期されたアバター動画を同時に生成する対話フレームワーク「Ex-Omni-2D」が発表された。モデルがシーンや感情を描写する「Visual Thought Plan」と音声ユニットを統合予測し、それをアバター動画のフレームとリアルタイムに位置合わせする仕組みを持つ。大規模な4者(問い合わせ・テキスト・音声・動画)ペアデータなしで学習可能である。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。

画像・動画生成 / 音声・音楽

この話題に関わるコラム