トレンド一覧

ソーシャル・オーディオ・ビジュアル・質問回答のための推論: 現在の状況

arXiv cs.CV ・ 2026-08-13

原題: Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?

AI による要約

マルチモーダル・ラージ・ランゲージ・モデルは、ソーシャル・オーディオ・ビジュアルの理解に重要な役割を果たす。チェーン・オブ・ソート(CoT)推論は、ソーシャル・オーディオ・ビジュアルの理解のための主要なアプローチである。HumanOmniV2とIntentBenchは、CoT推論のための重要なベンチマークである。ただし、IntentBenchにはノイズが含まれており、質問の約7%が破損している。Vanilla SFTベースラインは、CoT推論のための新たなベンチマークを提供する。Vanilla SFTベースラインは、既存の推論方法を超える性能を示す。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CV)をご確認ください。

研究・論文

この話題に関わるコラム