大規模推論モデルの超知能化に向けた人間監視不要の学習手法
arXiv cs.AI ・ 2026-08-31
原題: Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence
AI による要約
大規模推論モデル(LRM)が人間の監視なしで能力を向上させる手法を提案する。検証可能な報酬を用いた強化学習(RLVR)を数学やコード分野で実証済みだが、オープンエンドなタスクでは報酬設計が困難な課題があった。本研究は、人間のフィードバックが徐々に不要となる学習ループの構築を目指す。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。