トレンド一覧

CreditCardQA: クレジットカード契約書に基づく金融推論ベンチマーク

arXiv cs.CL ・ 2026-07-29

原題: Credit Cards, Confusion, Computation, and Consequences: What Can We Uncover About Language Model Reasoning?

AI による要約

実際のクレジットカード規約から構築された1,800問の金融ベンチマーク「CreditCardQA」を導入し、言語モデルの数値・論理推論能力を評価した。モデルの誤りは四則演算よりも複雑な金融ルールや契約条件の誤解に起因することが判明し、PoTプロンプトの有効性が示された。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。

LLM・基盤モデル / 研究・論文