Pass the Baton: Trajectory-Relayed On-Policy Distillation
arXiv cs.AI ・ 2026-07-28
AI による要約
LLMのオンポリシー蒸留において、生徒モデルが初期の推論で躓いた際に教師モデルが一時的に生成を引き継ぐ「Relay-OPD」手法が提案されました。この手法により、無駄な計算を削減しながら重要な誤り発生ポイントで効率的な学習指導が可能になり、モデルの蒸留性能が向上します。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。