トレンド一覧

複雑な都市環境におけるマルチモーダルLLMの根拠評価ベンチマーク

arXiv cs.AI ・ 2026-08-11

原題: Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes

AI による要約

悪条件下の複雑な都市環境においてマルチモーダル大規模言語モデル(MLLM)の推論信頼性を診断するベンチマーク「AD2-Bench」が提案された。推論過程を階層的な証拠チェーンに分解することで、視覚的根拠の獲得不足や認識と推論の乖離を詳細に分析可能にする。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。

LLM・基盤モデル / 研究・論文

この話題に関わるコラム