Fisher-R1: 確実な仮説検証を行えるLLMエージェントの学習と評価
arXiv cs.AI ・ 2026-08-07
原題: Fisher-R1: Training LLM Agents for Reliable Hypothesis Testing
AI による要約
LLMエージェントによる統計的推論エラーを検出するため、経済学や医学など425個の課題を含むベンチマーク「P-Bench」が構築された。あわせて適切な統計手法選定とp値計算を行うオープンモデル「Fisher-R1」が導入され、自動化された科学的仮説検証の信頼性を向上させている。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。