トレンド一覧

LLMエージェント評価用ベンチマークAgentHPOBench

arXiv cs.AI ・ 2026-07-31

原題: AgentHPOBench: A Benchmark For Evaluating LLM Agents as Sequential Hyperparameter Optimizers

AI による要約

LLMエージェントを実験科学者として評価するための新しい逐次型ベンチマーク「AgentHPOBench」が発表された。実験結果を解釈して次のハイパーパラメータ決定に活かす能力を、複数のタスクと統一プロトコルで比較検証できる。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。

研究・論文 / AIエージェント