画像生成を補助学習とし推論コストなしで視覚理解を高めるGAS手法
arXiv cs.CV ・ 2026-08-12
原題: Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction
AI による要約
視覚的理解モデルの性能向上のため、画像生成を補助的な監督信号として利用する学習フレームワーク「GAS」が提案された。分離型Mixture-of-Transformers構成と埋め込み予測手法を採用することで、推論時の計算コストを増大させることなく視覚モデルの空間的表現力を高める。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CV)をご確認ください。