トレンド一覧

RCI:スパースな評価信号から密なコストを推定する安全オフライン強化学習

arXiv cs.AI ・ 2026-08-12

原題: Redistribution-based Cost Inference Improves Sparse Safe Offline RL

AI による要約

エピソード単位の警告信号しか得られない環境において、安全なオフライン強化学習を行う枠組み「RCI」が開発された。リターン分解を用いてスパースな不安全シグナルを各ステップのコストに分配することで、理論的な最適性を維持しながら制約違反率を大幅に低減する。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。

研究・論文

この話題に関わるコラム