長尺動画理解に向けた生成型潜在エビデンス集約手法GenEvA
arXiv cs.CV ・ 2026-07-30
原題: Beyond Frame Selection: Generative Latent Evidence Aggregation for Long-Video Understanding
AI による要約
従来の長尺動画理解モデルは動画を数フレームに圧縮して処理するが、複数時点に跨る視覚的証拠の適切な統合が困難であった。新手法GenEvAは、質問に応じた分布を用いて選択フレームから関連情報をクロスフレームの潜在エビデンスへ集約し、動画理解の精度を高める。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CV)をご確認ください。