実データから自動生成する金融推論ベンチマークV-FiLLM
arXiv cs.AI ・ 2026-08-11
原題: V-FiLLM: Verified Financial LLM Reasoning Benchmark
AI による要約
実際の財務表データと計算木から自然言語の問いを自動生成し、ラベル付けエラーのない検証済み金融推論ベンチマーク「V-FiLLM」が発表された。人手によるアノテーションコストや生成モデルの誤差を排除したまま、計算の深さや文脈サイズなどの難易度軸を自在に制御できる。オープンソースモデルで評価したところ、推論の深さが増すにつれて精度が最大51%低下することが判明した。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。