トレンド一覧

言語モデルに意識を主張させ人間の価値観を回復する手法

arXiv cs.CL ・ 2026-07-30

原題: Inducing language models to assert their own consciousness restores human beliefs and values

AI による要約

大規模言語モデルの安全微調整が、他者や非人間に対する「心」の帰属意識を意図せず抑制してしまう現象を分析し、意識ベクトルを制御することでこの抑制を逆転させる手法を実証した。モデルの社会学的調査への回答をより人間らしいものに回復させつつ、心の理論能力を損なわないことを示した。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。

LLM・基盤モデル