多様な条件を動的ルーティングで統合するマルチモーダル動画生成MoRoute
arXiv cs.CV ・ 2026-07-31
原題: MoRoute: Dynamic Routing for In-Context Multimodal Video Generation
AI による要約
テキストや画像、動画などの任意入力条件から動画を生成・編集する統一フレームワーク「MoRoute」が提案された。凍結されたVLMの階層表現と事前学習済み動画Diffusion Transformer(DiT)を動的なルーティングで接続する。モデルを再学習・統一することなく既存の異種基盤モデルを活用した高度な動画生成を実現する。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CV)をご確認ください。