DeepSeek V4 Flashに軽量コネクタを追加学習させて視覚機能を実装
r/LocalLLaMA ・ 2026-08-11
原題: I gave DeepSeek V4 Flash basic vision by training a 40M connector on 100K examples
AI による要約
DeepSeek V4 Flashと画像エンコーダMoonViTを固定し、4000万パラメータのコネクタを10万件のデータで学習させることで言語モデルに視覚機能を付与した。作成されたモデルはSGLang環境で動作し画像プロンプトに応答できる。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(r/LocalLLaMA)をご確認ください。