トレンド一覧

MMPOとGRPOの平均最適化

Qiita AI ・ 2026-08-13

原題: MMPOはGRPOの平均最適化を捨て失敗分布のモーメントを削る

AI による要約

MMPOはGRPOの平均最適化を捨て、失敗分布のモーメントを削る。平均正答率が同じ二つのモデルでも、中身はまるで違う。強化学習で推論モデルを鍛えるとき、平均を最適化しているという問題について言及されている。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(Qiita AI)をご確認ください。

LLM・基盤モデル

この話題に関わるコラム