SFT-RL 予算配分の最適化手法を大規模モデルに拡張
arXiv cs.AI ・ 2026-09-01
原題: Scaling Near-Optimal SFT-RL Annotation Budget Allocation from Small to Large LLMs
AI による要約
SFT と RL への予算配分を最適化する手法を提案する。小規模モデルで特定した「準最適領域」が大規模モデルに転移可能であることを示し、少ない実験で効率的な配分が可能になる。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。