WSV:ゼロショットビデオキャプションのための視覚シンセシスとクロスモーダル表現の整列
arXiv cs.CV ・ 2026-08-11
原題: Watching Synthetic Videos: Aligning Cross-modal Representations with Visual Synthesis for Zero-shot Video Captioning
AI による要約
ゼロショットビデオキャプションでは、ビデオの分布が学習時に利用できないため、クロスモーダルギャップが発生する。研究者は、WSVフレームワークを提案しており、視覚シンセシスとクロスモーダル表現の整列を通じてゼロショットビデオキャプションを実現する。WSVは、テキストからビデオの潜在的な表現を生成し、ビデオの分布と整列させる。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CV)をご確認ください。