トレンド一覧

MaRフレームワークでLLMの推論軌跡をメタ認知で最適化

Zenn LLM ・ 2026-08-07

原題: MaR: メタ認知を報酬に変えるRLで推論軌跡を直接最適化

AI による要約

MaR(Metacognition-as-Reward)は、LLMの推論軌跡をメタ認知の次元で直接最適化するフレームワークだ。知識抽出・プロセス制御・最終回答の3段階に分け、軌跡レベルの報酬で最適化する。Qwen3.5-9B + MaRはGPT-OSS-1と同等の性能を達成し、22ベンチマークで最大+7.7%の改善を示した。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(Zenn LLM)をご確認ください。

研究・論文