トレンド一覧

推論モデルのオンポリシー自己蒸留を高精度化する手法DASH

arXiv cs.AI ・ 2026-08-06

原題: DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models

AI による要約

大規模言語モデルの推論能力を高めるオンポリシー自己蒸留(OPSD)において、ダイバージェンスの履歴に応じて視界を動的に調整する「DASH」が提案された。従来のOPSDがすべての局所的乖離を一律に扱っていた課題を解消し、生成軌跡の時系列構造を考慮した指導を可能にする。これにより、検証可能な報酬に基づく強化学習(RLVR)のシグナル疎性を補い、推論精度を向上させる。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。

研究・論文 / LLM・基盤モデル

この話題のこれまで

推論モデルの効率化と精度向上を目指す研究が相次いでいる。まず自己検証と強化学習を組み合わせたSVRフレームワークが提案され、推論時の計算量を動的に最適化する手法が示された。次に指示付き探索と自己蒸留を用いるICE手法により、未知タスクへの適応性が向上した。続いてCaRLが徒労推理の抑制に成功し、推論の無駄を減らす取り組みが加わった。その後、検証可能な報酬に基づく強化学習のシグナル疎性を補うDASHが提案され、推論精度のさらなる向上が図られた。

  1. 自己検証と強化学習で推論計算量を動的に最適化するSVRフレームワーク 2026-07-30 ・ arXiv cs.AI
  2. 指示付き探索と自己蒸留でLLMの強化学習性能を高める「ICE」 2026-08-03 ・ arXiv cs.CL
  3. 徒労推理をやめる:CaRLがLLMに諦め方を教える 2026-08-04 ・ Zenn LLM

当サイトが集めた記事から、同じ話題のものを古い順に並べています。