大規模推論モデルにおける忠実性と安全性のトレードオフとその解決アプローチ
arXiv cs.CL ・ 2026-08-04
原題: Risky Business: Measuring The Faithfulness-Safety Tension
AI による要約
大規模推論モデルにおける忠実性と安全性のトレードオフを解消する「HazMart」データセットと_Targeted Reasoning Replacement(TRR)_手法が発表された。推論チェーンに不安全な思考を直接挿入してモニタリングの堅牢性を評価する。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。