大規模推論モデル蒸留時のスタイルバイアスを軽減するLightning OPD 2.0
arXiv cs.CL ・ 2026-07-30
原題: Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models
AI による要約
異なる教師モデルからオンポリシー蒸留(OPD)を行う際に生じるスタイル上の違いやバイアスを軽減する新手法「Lightning OPD 2.0」が提案された。言い回しやフォーマットの齟齬を取り除くことで、推論モデルの学習効率と精度を大幅に改善する。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。