推論モデルのオンポリシー自己蒸留を高精度化する手法DASH
arXiv cs.AI ・ 2026-08-06
原題: DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models
AI による要約
大規模言語モデルの推論能力を高めるオンポリシー自己蒸留(OPSD)において、ダイバージェンスの履歴に応じて視界を動的に調整する「DASH」が提案された。従来のOPSDがすべての局所的乖離を一律に扱っていた課題を解消し、生成軌跡の時系列構造を考慮した指導を可能にする。これにより、検証可能な報酬に基づく強化学習(RLVR)のシグナル疎性を補い、推論精度を向上させる。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。