オンポリシー蒸留は1件の学習データでも大半の性能向上を再現可能
arXiv cs.AI ・ 2026-09-03
原題: Rethinking On-Policy Distillation of Large Language Models II: One Training Example
AI による要約
LLMのオンポリシー蒸留において単一のクエリのみを用いた極小データ学習でも数百ステップの更新で全データ蒸留の性能利得の大半を再現できることが示された。訓練中の状態カバレッジを測定した結果、単一クエリで全データ学習時の71.5%の状態に到達し、16クエリで98.9%に達して全データ学習に匹敵した。この成果によりオンポリシー蒸留における学習データの役割が状態探索の観点から解明された。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。