LLMエージェント評価用ベンチマークAgentHPOBench
arXiv cs.AI ・ 2026-07-31
原題: AgentHPOBench: A Benchmark For Evaluating LLM Agents as Sequential Hyperparameter Optimizers
AI による要約
LLMエージェントを実験科学者として評価するための新しい逐次型ベンチマーク「AgentHPOBench」が発表された。実験結果を解釈して次のハイパーパラメータ決定に活かす能力を、複数のタスクと統一プロトコルで比較検証できる。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。