DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data
arXiv cs.AI ・ 2026-07-27
AI による要約
LLMの事前学習データをサンプル単位で動的に加工・管理するフレームワーク「DataOrchestra」が提案されました。データごとに最適な破棄・削除・再記述などの操作を判断してパイプラインを編成することで、モデルの事前学習効率とダウンストリーム性能の大幅な向上を実現します。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。