Hugging Faceらが古いOCRテキスト改善プロジェクトFineBooksを開始
The Decoder ・ 2026-08-10
原題: Old OCR text cripples language model training, and FineBooks wants to fix that at scale
AI による要約
Hugging FaceとEleutherAIが歴史的書籍2,000ページ超を用いて14種類のオープンソースOCRモデルを検証するFineBooksプロジェクトを実施した。最高精度のdots.mocrは1,000ページあたり2ドル未満で97.6%の文字精度を達成し、AI学習データの質向上に寄与する。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(The Decoder)をご確認ください。