トレンド一覧

大規模推論モデルにおける忠実性と安全性のトレードオフとその解決アプローチ

arXiv cs.CL ・ 2026-08-04

原題: Risky Business: Measuring The Faithfulness-Safety Tension

AI による要約

大規模推論モデルにおける忠実性と安全性のトレードオフを解消する「HazMart」データセットと_Targeted Reasoning Replacement(TRR)_手法が発表された。推論チェーンに不安全な思考を直接挿入してモニタリングの堅牢性を評価する。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。

LLM・基盤モデル / 規制・倫理

この話題に関わるコラム