マルチアームバンディットの後悔と不安定性の最適トレードオフを理論的に解明
arXiv cs.LG ・ 2026-08-18
原題: Toward the Optimal Regret-Instability Trade-off in Multi-Armed Bandits
AI による要約
マルチアームバンディット問題で後悔と不安定性のトレードオフの下限を理論的に証明した。新たなSLE-UCBアルゴリズムにより、後悔と不安定性の積がO(T^(3/2) log K)で抑えられることを示した。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.LG)をご確認ください。