Forensic Reproducibility Audit of a Radiology Vision-Language Model Benchmark: From Intended Protocol to Released Artifact
arXiv cs.CL ・ 2026-07-28
AI による要約
放射線画像向け視覚言語モデル(VLM)ベンチマークに対する事後フォレンジック監査が行われ、プロンプトの誤適用や画像変換エラーなどの重大な不一致が発見されました。医療AIにおける評価基盤の不備を浮き彫りにし、信頼できる検証プロトコルの必要性を示しています。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。