多模態LLMによる画像系列の時系列順序評価における限界と課題
arXiv cs.CL ・ 2026-08-11
原題: Order Matters: LVLMs as Judges for Temporal Reasoning in Image Sequences
AI による要約
多模態大規模言語モデル(LVLM)を画像系列の時系列順序判断者として利用する際の精度崩壊問題が指摘された。実験により、単一でのスコアリングでは良好に見えるLVLMも、2つの画像系列から時系列的な正しさを見分けるペア選択では性能が著しく悪化することが判明した。現行の自動評価パラダイムには構造的な偏りがあり改善が必要だと提言している。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。