ソーシャル・オーディオ・ビジュアル・質問回答のための推論: 現在の状況
arXiv cs.CV ・ 2026-08-13
原題: Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?
AI による要約
マルチモーダル・ラージ・ランゲージ・モデルは、ソーシャル・オーディオ・ビジュアルの理解に重要な役割を果たす。チェーン・オブ・ソート(CoT)推論は、ソーシャル・オーディオ・ビジュアルの理解のための主要なアプローチである。HumanOmniV2とIntentBenchは、CoT推論のための重要なベンチマークである。ただし、IntentBenchにはノイズが含まれており、質問の約7%が破損している。Vanilla SFTベースラインは、CoT推論のための新たなベンチマークを提供する。Vanilla SFTベースラインは、既存の推論方法を超える性能を示す。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CV)をご確認ください。