トレンド一覧

ビデオ言語モデルはシンプルなイベントの記録に失敗する

arXiv cs.AI ・ 2026-08-06

原題: The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping

AI による要約

ビデオ言語モデルは、シンプルなイベントの記録に失敗することがわかった。研究者は、3つの制御されたビデオタスクで、イベントの数と頻度を変化させた結果、モデルは80%の信頼性のしきい値で12イベントまでカウントできることがわかった。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。

LLM・基盤モデル