ビデオ言語モデルはシンプルなイベントの記録に失敗する
arXiv cs.AI ・ 2026-08-06
原題: The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping
AI による要約
ビデオ言語モデルは、シンプルなイベントの記録に失敗することがわかった。研究者は、3つの制御されたビデオタスクで、イベントの数と頻度を変化させた結果、モデルは80%の信頼性のしきい値で12イベントまでカウントできることがわかった。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。