トレンド一覧

大規模推論モデルにおける忠実性と安全性のトレードオフとその解決アプローチ

arXiv cs.CL ・ 2026-08-04

原題: Risky Business: Measuring The Faithfulness-Safety Tension

AI による要約

大規模推論モデルにおいて、モデルの監視に必要な「忠実性」と、安全でない推論を拒否する「安全性」の間にアライメントの緊張関係が存在することを示した。推論チェーンに介入する新たな手法「TRR」を提案し、この課題に対処する方法を実証したため重要である。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。

LLM・基盤モデル / 規制・倫理