VLM誘導型トランジションイベント検出を用いた弱教師あり密動画キャプション生成
arXiv cs.AI ・ 2026-09-03
原題: Seeing Before Synthesizing: VLM-Guided Transition Event Discovery for Weakly-Supervised Dense Video Captioning
AI による要約
未トリミング動画内の複数イベントを局所化・記述するフレームワークSBSを提案する。VLMを活用してイベント間のフレームレベルのナラティブを生成し、視覚的に根拠のある言語的ガイダンスを適応的に提供する。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。