MMPOとGRPOの平均最適化
Qiita AI ・ 2026-08-13
原題: MMPOはGRPOの平均最適化を捨て失敗分布のモーメントを削る
AI による要約
MMPOはGRPOの平均最適化を捨て、失敗分布のモーメントを削る。平均正答率が同じ二つのモデルでも、中身はまるで違う。強化学習で推論モデルを鍛えるとき、平均を最適化しているという問題について言及されている。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(Qiita AI)をご確認ください。
Qiita AI ・ 2026-08-13
原題: MMPOはGRPOの平均最適化を捨て失敗分布のモーメントを削る
MMPOはGRPOの平均最適化を捨て、失敗分布のモーメントを削る。平均正答率が同じ二つのモデルでも、中身はまるで違う。強化学習で推論モデルを鍛えるとき、平均を最適化しているという問題について言及されている。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(Qiita AI)をご確認ください。