トレンド一覧

数学的推論の自動形式化における忠実度を評価するベンチマークの提案

arXiv cs.AI ・ 2026-08-11

原題: FaithformBench: Benchmarking Faithfulness of Mathematical Chain-of-Thought Autoformalisation

AI による要約

自然言語の推論ステップをLeanなどの証明助手へ変換する自動形式化の忠実度を判定する評価基準「FaithformBench」を提案した。推論ステップに意図的な変化を加えた摂動データを自動生成し、正しい入力と誤った入力の双方の変換正確性を検証する。高価な手動アノテーションや信頼性の低いLLM判定に頼らず低コストで評価できる。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。

研究・論文 / LLM・基盤モデル

この話題に関わるコラム