前提条件不足の推論に対応する強化学習手法 ACA-RLとベンチマークMPB
arXiv cs.CL ・ 2026-08-17
原題: Ask, Condition or Abstain: Reinforcement Learning for Missing-Premise Reasoning
AI による要約
前提条件が不足するクエリに対応する強化学習手法「ACA-RL」を発表した。数学・論理・実世界の問題274件で構成されるベンチマーク「MPB」を新規に作成。モデルに前提条件を尋ねる、条件付きで回答する、棄権するなど5種類の挙動を報酬で学習させる。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。