Spurious Advantage Hidden in GRPO
arXiv cs.AI ・ 2026-09-03
AI による要約
検証可能な報酬を用いる強化学習手法GRPOにおいて、推論ではなく当てずっぽうの回答でも高い優位性が割り当てられる「スプリアス・アドバンテージ」が発生することを特定した。この問題を解決するため、ベリファイアの符号を維持しつつグローバルなスケールを用いてゼロ平均のバランスを回復する手法「SIGNBALANCE」を提案した。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。