小規模VLMのマルチタスク学習による消化管内視鏡VQAの改善
arXiv cs.CV ・ 2026-07-29
原題: Towards Grounded GI Endoscopy VQA via Multi-Task Learning on Small VLMs
AI による要約
消化管内視鏡画像の視覚的質問応答(VQA)において、モデルが回答の根拠となる視覚的証拠を内部表現に反映させるマルチタスクファインチューニング手法。最小限の追加アノテーションで小規模VLMの精度と説明可能性を向上させる。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CV)をご確認ください。