長期推論のスキル移行を評価するスキルエントロピーとSkill^2-Bench
arXiv cs.CL ・ 2026-08-05
原題: Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning
AI による要約
LLMの複雑な長期推論タスクにおいて、複数の異なるスキルを切り替える難易度を測定する指標「スキルエントロピー」と新しいベンチマーク「Skill^2-Bench」が提案された。これにより、モデルがスキル間を適切に移行する能力を多角的に評価できる。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。