RCI:スパースな評価信号から密なコストを推定する安全オフライン強化学習
arXiv cs.AI ・ 2026-08-12
原題: Redistribution-based Cost Inference Improves Sparse Safe Offline RL
AI による要約
エピソード単位の警告信号しか得られない環境において、安全なオフライン強化学習を行う枠組み「RCI」が開発された。リターン分解を用いてスパースな不安全シグナルを各ステップのコストに分配することで、理論的な最適性を維持しながら制約違反率を大幅に低減する。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。