トレンド一覧

視覚的推論を高めるマルチモーダル自己蒸留手法OPD-V

arXiv cs.AI ・ 2026-08-05

原題: OPD-V: Visual On-Policy Self-Distillation with Modality Balance

AI による要約

マルチモーダル大規模言語モデル(MLLM)の視覚的推論を改善する自己蒸留手法「OPD-V」が提案された。テキスト情報が優位な状態を改善するため、ズームイン画像とマスク画像を用いた「Positive Teacher」と「Negative Teacher」を導入し、モダリティバランスを特権情報として活用する仕組みだ。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。

LLM・基盤モデル / 研究・論文

この話題に関わるコラム