オンポリシー蒸留の実効性を検証する分析手法を提案
arXiv cs.CL ・ 2026-08-31
原題: Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement
AI による要約
オンポリシー蒸留(OPD)が本当に蒸留効果を持つのかを定量的に分析する。教師モデルのノイズが多いにもかかわらず、学生モデルの性能向上は低確率トークンへの集中に起因することを示す。固定された負の利得でも同等の性能を達成できる。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。