トレンド一覧

SFT-RL 予算配分の最適化手法を大規模モデルに拡張

arXiv cs.AI ・ 2026-09-01

原題: Scaling Near-Optimal SFT-RL Annotation Budget Allocation from Small to Large LLMs

AI による要約

SFT と RL への予算配分を最適化する手法を提案する。小規模モデルで特定した「準最適領域」が大規模モデルに転移可能であることを示し、少ない実験で効率的な配分が可能になる。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。

この話題に関わるコラム