トレンド一覧

外部環境なしでツール利用を事前学習するエージェント強化学習手法

arXiv cs.AI ・ 2026-08-06

原題: EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning

AI による要約

大規模言語モデルエージェントの長期的ツール利用学習に向け、外部環境との対話の代わりに試行を自律シミュレートする「EnvACE」を提案した。行動決定と環境の応答予測を同一モデル内で行うワールドリハーサルにより、環境ダイナミクスをパラメータ内に内部化する。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。

AIエージェント / LLM・基盤モデル

この話題のこれまで

強化学習におけるワールドモデルの研究が進み、報酬以外の情報を活用する非対称型表現学習や、マルチエージェント環境での因果構造の推定、ゲームの内部状態を予測する一貫性モデルが提案された。その後、ロボット操作のための視覚・言語・行動モデルの報酬モデル課題を解決する手法や、自律進化するエージェントの記憶制御、サイバー物理システムでの計画戦略評価が発表された。この流れを受け、大規模言語モデルエージェントの長期的ツール利用学習に向け、外部環境なしで試行をシミュレートする手法が提案された。

  1. 潜在的ガイダンスを通じて効率的に学習する非対称型ワールドモデル 2026-07-28 ・ arXiv cs.LG
  2. マルチエージェントデモからの暗黙的因果ワールドモデル学習 2026-07-28 ・ arXiv cs.MA
  3. ゲームのルールに一貫性を持たせるワールドモデルStatePlay 2026-07-29 ・ arXiv cs.CV
  4. VLA強化学習の報酬モデル課題を克服するワールド批評家モデルWCM 2026-07-31 ・ arXiv cs.CL
  5. 自己進化エージェントの記憶制御を行う強化学習手法RoMeRL 2026-08-03 ・ arXiv cs.CL
  6. サイバー物理システムにおけるLLMエージェントの計画戦略評価 2026-08-04 ・ arXiv cs.MA

当サイトが集めた記事から、同じ話題のものを古い順に並べています。

この話題に関わるコラム