TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM
arXiv cs.CV ・ 2026-07-29
AI による要約
従来の大規模言語モデル中心のVLAパラダイムを改め、視覚と言語を直接マッピングすることで軽量化と高速化を実現したモデル「TurboVLA」の提案。RTX 4090上で1GB未満のVRAMを使用し、32Hzのリアルタイム動作を達成している。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CV)をご確認ください。