高次オプティミズムによる一般ゲームでの定数リグレットの達成
arXiv cs.LG ・ 2026-09-03
原題: Constant regret in general games via higher-order optimism
AI による要約
任意のエージェント数と行動数を持つ通常ゲームにおいて、個別のリグレットを定数に抑える非結合型学習アルゴリズム「HOOD」を提案した。割引率を適用した $(N+1)$ 次予測子とエントロピー正則化を組み合わせることで、プレイ列の大きな振動を抑制し、従来の手法における課題を克服した。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.LG)をご確認ください。