低資源言語での推論を可能にする SFT と RL の役割分担
arXiv cs.CL ・ 2026-08-18
原題: Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See
AI による要約
3つの最先端 MoE モデル(Alibaba、OpenAI、NVIDIA)を低資源言語でファインチューニングしたところ、正解率ベンチマークでは変化が見られなかったが、推論過程が言語に一致するようになった。SFT で98%が言語固有の推論に、RL で文法性と一般能力が改善した。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。