Gradient Immunity: マルチファインチューニングへの耐性
arXiv cs.AI ・ 2026-08-05
原題: Gradient Immunity: Null-Space Resistance to Malicious Fine-Tuning
AI による要約
部分的に保護されたオープンウェイトモデルで、悪意のあるファインチューニングに耐性を持たせる「Gradient Immunity」手法を開発。Unidirectional Safety Gate(USG)により有害なサンプルの勾配を抑制し、安全性を維持する。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.AI)をご確認ください。