複数参照画像に対応した動画キャプション生成手法RefCaptioner
arXiv cs.CV ・ 2026-07-30
原題: RefCaptioner: Multi-Reference Image-Grounded Video Captioning
AI による要約
動画内の要素を複数の参照画像と直接結びつけて客観的に説明する「マルチリファレンス画像グラウンディング動画キャプション生成」タスクを提案した。新開発のRefCaptionerは2段階の事後学習フレームワークにより誤検出を抑え高い整合性を実現し、検証用大規模データセットと評価ベンチマークも公開した。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CV)をご確認ください。