トレンド一覧

動画基盤モデルの時空間表現をプロービング手法で徹底分析

arXiv cs.CV ・ 2026-09-01

原題: What, Where, and How: Probing Spatiotemporal Representations in Video Foundation Models

AI による要約

V-JEPA 2やVideoMAE-v2などの動画基盤モデルが獲得する時空間表現の幾何学的構造や創発層を系統的に分析した研究が発表された。カメラ動作の理解はネットワークの深さ60〜70%でROC AUC 90%超と強く表れる一方、異常検知は中程度にとどまり、直感的物理の理解は偶然レベルに近いことが判明した。これにより、既存モデルが高次元の物理推論能力を十分に学習できていない現状が明らかになった。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CV)をご確認ください。

画像・動画生成 / 研究・論文

この話題に関わるコラム