トレンド一覧

ReflectRL: ゴールデン・ネガティブ・トラジェクトリからの反省的推論

arXiv cs.AI ・ 2026-08-04

原題: ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning

AI による要約

ReflectRLは、ゴールデン・ネガティブ・トラジェクトリからの反省的推論を可能にするフレームワークである。ゴールデン・ネガティブ・トラジェクトリは、エキスパートモデルが失敗したトラジェクトリである。ReflectRLは、これらのトラジェクトリから反省的推論を導出することで、LLMの推論能力を向上させる。ReflectRLは、LLMが複雑なタスクを解決するための新しいアプローチを提供する。LLMの性能を向上させることができる。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。

LLM・基盤モデル