画像とテキストの要素を混ぜ合わせる物体レベルの多峰性コードスイッチング
arXiv cs.CL ・ 2026-08-11
原題: MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment
AI による要約
テキスト中のエンティティを対応する画像オブジェクトに置換して事前学習を行う手法「MultiModal Code-Switching (MMCS)」が提案された。従来の画像全体とテキストの対応付けにおける曖昧さを解消し、77万件の合成データセットを用いて局所的な視覚・言語の照合精度を強化する。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。