トレンド一覧

ベンガル語シーンテキスト認識用の実環境ベンチマークBanglaWild

arXiv cs.CL ・ 2026-08-04

原題: BanglaWild: An In-the-Wild Bengali Scene Text Recognition Benchmark for OCR and Vision-Language Models

AI による要約

ベンガル語の実環境シーンテキスト認識ベンチマーク「BanglaWild」を新たに公開し、2,535枚の画像に対して15のVLMと3の従来OCRを3種類のプロンプティングで評価。同一ファミリー内では大規模モデルが必ずしも性能向上につながらないギャップを明らかにした。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。

LLM・基盤モデル / 画像・動画生成

この話題に関わるコラム