Language Models are not Equally Robust to Non-Canonical Tokenization across Languages
arXiv cs.CL ・ 2026-07-29
AI による要約
トークン化のバリエーションに対する言語モデルの頑健性を27言語で横断的に調査した。英語ではモデルが代替トークン化に対して不変性を示す一方で、この特性が他の言語には一様に汎化しないことを明らかにした。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。