トレンド一覧

VLM誘導型トランジションイベント検出を用いた弱教師あり密動画キャプション生成

arXiv cs.AI ・ 2026-09-03

原題: Seeing Before Synthesizing: VLM-Guided Transition Event Discovery for Weakly-Supervised Dense Video Captioning

AI による要約

未トリミング動画内の複数イベントを局所化・記述するフレームワークSBSを提案する。VLMを活用してイベント間のフレームレベルのナラティブを生成し、視覚的に根拠のある言語的ガイダンスを適応的に提供する。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。

画像・動画生成

この話題に関わるコラム