人間とマルチモーダルLLMの親密度推論を評価するFriendBench
arXiv cs.AI ・ 2026-07-31
原題: FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Language Models
AI による要約
初対面か既知の仲かを見極める会話クリップを用いて、人間と26種類のマルチモーダルLLMの親密度推論能力を比較評価するベンチマーク「FriendBench」を導入した。AIモデルの社会的状況理解における人間との違いや課題を明らかにするもので、マルチモーダルAIの性能評価において重要である。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。