トレンド一覧

低資源言語での推論を可能にする SFT と RL の役割分担

arXiv cs.CL ・ 2026-08-18

原題: Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See

AI による要約

3つの最先端 MoE モデル(Alibaba、OpenAI、NVIDIA)を低資源言語でファインチューニングしたところ、正解率ベンチマークでは変化が見られなかったが、推論過程が言語に一致するようになった。SFT で98%が言語固有の推論に、RL で文法性と一般能力が改善した。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。

研究・論文

この話題に関わるコラム