CLIP系モデルを活用した視覚・言語実験における視線挙動予測手法
arXiv cs.CL ・ 2026-08-07
原題: Gaze Behavior in Visual World Experiments Can be Modeled With Off-the-shelf Language-Vision Encoders
AI による要約
CLIPファミリーのバイエンコーダとバイモーダル属性付与手法を組み合わせ、人間の視覚・言語実験における視線移動パターンを再現するアプローチが開発された。生成モデルを用いずに視覚と言語の統合的な予測処理メカニズムをモデル化することに成功している。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。