World Tokensで強化された身体ポリシーの学習手法
arXiv cs.CV ・ 2026-08-10
原題: World Tokens: Enhancing Embodied Policies with Training-Time World Modeling
AI による要約
Vision-Language-Action(VLA)モデルに物理シーンの時間的進化を明示的にモデル化するWorld Tokensを導入。World AdapterがVLM特徴をWorld Tokensに変換し、将来ビデオデノイザーと連動して行動ポリシーを強化。学習時のみ世界モデリングを活用し、推論時のコストを抑える。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CV)をご確認ください。