ReflectRL: ゴールデン・ネガティブ・トラジェクトリからの反省的推論
arXiv cs.AI ・ 2026-08-04
原題: ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning
AI による要約
ReflectRLは、ゴールデン・ネガティブ・トラジェクトリからの反省的推論を可能にするフレームワークである。ゴールデン・ネガティブ・トラジェクトリは、エキスパートモデルが失敗したトラジェクトリである。ReflectRLは、これらのトラジェクトリから反省的推論を導出することで、LLMの推論能力を向上させる。ReflectRLは、LLMが複雑なタスクを解決するための新しいアプローチを提供する。LLMの性能を向上させることができる。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。