完全オープンな訓練レシピに基づく画像生成フレームワーク「LLaDA-Image」
arXiv cs.CV ・ 2026-09-03
原題: LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes
AI による要約
完全オープンなトレーニングレシピを採用した6Bの拡散トランスフォーマー(DiT)と、LLaDA2.0-Miniをベースにした視覚言語理解モジュールを統合した画像生成フレームワーク「LLaDA-Image」を発表した。RMSNormとMuonオプティマイザーを用いることで、高写実的な画像の生成と微細な編集指示への追従を実現し、数ステップで高速推論する「LLaDA-Image-Turbo」も構築した。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CV)をご確認ください。