HumanCLAW: Can Vision-Language Models Act Through a Body?
arXiv cs.CV ・ 2026-07-29
AI による要約
ビジョン言語モデル(VLM)が身体を介して物理的に行動できるかを評価するための新しいフレームワーク「HumanCLAW」の提案。意思決定と低レベルの運動制御を分離することで、モデル本来の行動知性を正確に測定可能にする。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CV)をご確認ください。