マルチドメインLLM向け教師あり蒸留手法「MT-SDPO」を開発
arXiv cs.AI ・ 2026-09-02
原題: Learn from Whoever Is Right: Answer-Verified Multi-Teacher Distillation for Multi-Domain LLMs
AI による要約
マルチドメインLLMの統合に向け、複数の教師モデルを用いた自己蒸留手法MT-SDPOを提案した。各サンプルに対し正解教師を動的に選択することで、ドメインラベルに依存しない正確な指導を実現する。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。