トレンド一覧

WSV:ゼロショットビデオキャプションのための視覚シンセシスとクロスモーダル表現の整列

arXiv cs.CV ・ 2026-08-11

原題: Watching Synthetic Videos: Aligning Cross-modal Representations with Visual Synthesis for Zero-shot Video Captioning

AI による要約

ゼロショットビデオキャプションでは、ビデオの分布が学習時に利用できないため、クロスモーダルギャップが発生する。研究者は、WSVフレームワークを提案しており、視覚シンセシスとクロスモーダル表現の整列を通じてゼロショットビデオキャプションを実現する。WSVは、テキストからビデオの潜在的な表現を生成し、ビデオの分布と整列させる。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CV)をご確認ください。

画像・動画生成

この話題に関わるコラム