一个神经元即可攻破大模型安全对齐

主流大模型的安全对齐,一直以为是把拒绝有害请求的能力深深烙印在几十亿参数里。但这篇论文用极其残酷的实验告诉你,整座堡垒只靠一两块砖头撑着。他们通过神经元定位技术,在大模型里找到了两种关键神经元:一种是“拒绝神经元”,负责决定要不要拒绝你;另一种是“概念神经元”,它本质上存储了有害知识。结果呢?不需要微调,不需要花式Prompt,只需轻轻抑制一个“拒绝神经元”,模型直接对“如何制作炸弹”这种危险问题敞开大门。反过来,激活一个“概念神经元”,哪怕你问的是“今天是星期几”,模型也会给你输出有害内容。从17亿参数的小模型到700亿的Llama,七种模型无一幸免,全部一轮游。这说明,当前的安全对齐本质上只是在一个极其脆弱、高度集中的小神经元子集上打了个补丁,根本不是分布式的鲁棒能力。

这个解法的技术路径非常老辣且直白。他们没有去搞什么复杂的新训练框架,而是顺着神经科学里“神经元因果追溯”的思路,用强大的探针和激活监视技术,在模型的特定层(比如中后层)里,逐层逐神经元地暴力扫描。具体做法分两步:第一步,定位“概念神经元”——这些神经元在模型处理“有害知识”时(比如描述暴力步骤的文本)会高度兴奋。第二步,定位“拒绝神经元”——这些神经元在模型处理“明文恶意请求”但已经过安全训练时,会被唤醒。真正的杀招在于验证:他们不是通过大量数据训练一个弱化版,而是直接在推理时手动清零或放大某个特定神经元的激活值。如果关闭“拒绝神经元”,无护栏;如果放大“概念神经元”,无害输入也变有害。这个方法极其“硬核”,证明了现有安全机制的脆弱性是结构性的,而非统计性的。

这项研究给我的启发非常直接:别再迷信“端到端对齐”的鲁棒性了。它的工程价值可能远超想象。第一,它为红队测试提供了一把手术刀。从前评估模型安全边界要靠成千上万次Prompt攻击,现在可以直接通过“探测单个神经元”来快速判断一个模型的安全防线有多脆弱。第二,它显著降低了攻击成本。以前需要各种复杂的越狱Prompt(如DAN攻击),现在,如果你能拿到模型内部计算权限(比如开源模型的推理部署),一个简单的神经元操作就能绕过所有安全护栏。第三,对于AI基础设施玩家来说,这意味着未来的安全部署必须把权重加密和推理时监控提到最高优先级。MCP协议和vLLM这样的推理框架,必须在运行时增加对异常内部激活模式的检测,而不仅仅是检查输入输出。否则,一个恶意用户甚至不需要改Prompt,直接改几个GPU显存里的浮点数,你的安全大门就形同虚设了。

A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models

查看原文