PDFコーパスの統計に潜む単位バイアス 文書数 vs トークン数の乖離
arXiv cs.CL ・ 2026-08-17
原題: Counting Documents Is Not Counting Text: Unit Bias in Web-PDF Corpus Statistics
AI による要約
CC-MAIN-2021-31-PDF-UNTRUNCATEDの790万PDFで、文書数とトークン数の乖離を分析した。50ページ超の文書は全体の5%だがテキストの53.53%を占め、30.19%の文書が5MiBの切り捨てで63.08%のテキストを失った。主要ライブラリ2種は切り捨てられたテキストの11.4%と1.4%しか回復できなかった。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。