大規模推論モデルにおける忠実性と安全性のトレードオフとその解決アプローチ
arXiv cs.CL ・ 2026-08-04
原題: Risky Business: Measuring The Faithfulness-Safety Tension
AI による要約
大規模推論モデルにおいて、モデルの監視に必要な「忠実性」と、安全でない推論を拒否する「安全性」の間にアライメントの緊張関係が存在することを示した。推論チェーンに介入する新たな手法「TRR」を提案し、この課題に対処する方法を実証したため重要である。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。