トレンド一覧

長尺動画理解に向けた生成型潜在エビデンス集約手法GenEvA

arXiv cs.CV ・ 2026-07-30

原題: Beyond Frame Selection: Generative Latent Evidence Aggregation for Long-Video Understanding

AI による要約

従来の長尺動画理解モデルは動画を数フレームに圧縮して処理するが、複数時点に跨る視覚的証拠の適切な統合が困難であった。新手法GenEvAは、質問に応じた分布を用いて選択フレームから関連情報をクロスフレームの潜在エビデンスへ集約し、動画理解の精度を高める。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CV)をご確認ください。

画像・動画生成 / LLM・基盤モデル