トレンド一覧

INS-ActBench: A Comprehensive Benchmark for Assessing Professional Actuarial Capability of Large Language Models

arXiv cs.CL ・ 2026-07-27

AI による要約

LLMのアクチュアリー(保険数理士)としての専門業務能力を評価するベンチマーク「INS-ActBench」が開発されました。16の公的なアクチュアリー協会から収集した12,050個の問答ペアを含み、専門知識・長文ケース推論・計算ツールの統合利用という実務能力を総合的に測定可能にします。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。

LLM・基盤モデル / 研究・論文