トークン予測を通じた表現学習の幾何学的・近似的保証
arXiv stat.ML ・ 2026-08-30
原題: Learning Representations through Token Prediction: Geometry, Approximation, and Downstream Guarantees
AI による要約
現代の大規模言語モデルにおける主要な事前学習目的であるトークン予測が、どのように有用な表現を学習するのかを統計的枠組みで解明した。ソフトマックス予測ヘッドの下で、正確なトークン予測がヘリング距離によって測定される文脈の類似性に基づいてトークン埋め込みを組織化することを示した。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv stat.ML)をご確認ください。