カメラ条件付きワールドモデルの報酬モデル「WorldReward」
arXiv cs.CV ・ 2026-09-03
原題: WorldReward: Reward Modeling for Camera-Conditioned World Models
AI による要約
カメラ条件付きワールドモデルは、命令された動作が期待されるシーン変化を誘発し、外観や幾何学、時間的動態を一貫させる動画を生成する。既存の報酬関数は、幾何学ベースの報酬が軌道実行を評価するが、視覚的品質を判断できない。一方、画像ベースの報酬はフレームの品質を測定するが、動作実行や時間的動態を捉えられない。研究チームは、視覚言語モデル(VLM)を用いて、動作とその視覚的結果を統合した判断基準を構築。しかし、長時間のビデオとその全動作シーケンスを判断する際、短期的な動作証拠が希釈される問題を解決するため、「WorldReward」を提案。VLMベースのペアワイズ好み報酬モデルを用いて、動作一貫性と視覚品質の評価を統合した。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CV)をご確認ください。