トレンド一覧

非対称情報ゲームを用いてLLMの「心の理論」を評価するベンチマーク

arXiv cs.CL ・ 2026-08-10

原題: Avalon-ToM-Bench: Evaluating Fine-Grained Theory of Mind via Asymmetric Game Mechanics

AI による要約

不完全情報ゲーム「レジスタンス:アバロン」のルールを活用して、大規模言語モデルの「心の理論(ToM)」能力を評価する「Avalon-ToM-Bench」が提示された。28種類のLLMを評価した結果、モデルはゲームルールの理解度が高いものの、他者の状態推論やメンタルモデルに基づく行動選択には著しい課題があることが判明した。従来の静的テストでは捉えきれなかった社会的推論の欠陥を明らかにしている。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。

LLM・基盤モデル / 研究・論文

この話題に関わるコラム