VideoLMsの時間的理解を強化する表現レベルの対照目的関数VT-Contrast
arXiv cs.CV ・ 2026-09-03
原題: The Shape of Time: Video-Token Contrast for Temporal Understanding in VideoLMs
AI による要約
大規模動画言語モデル(VideoLMs)がオブジェクトや言語の事前知識に依存してイベントの進行を捉え損ねる問題に対処するため、表現レベルの時間的反実仮想目的関数「VT-Contrast」を提案した。言語生成前に情報が統合される選択された後層の最終フレーム動画トークンを監督し、順序を保持したビューと同一動画の並び替えられた反実仮想を比較する。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CV)をご確認ください。