指示付き探索と自己蒸留でLLMの強化学習性能を高める「ICE」
arXiv cs.CL ・ 2026-08-03
原題: Instruction-Conditioned Exploration with Asymmetric Reinforcement Learning and Self-Distillation
AI による要約
大規模言語モデルの強化学習において多面的な探索を促す「ICE」手法と、それを適用する「Asymmetric-RL/SD」学習目標が提案された。推論時の追加コストをかけずに事前に多様な行動パターンを学習させ、Qwen3-1.7Bなどの未知タスク性能を向上させた。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。