
动态缩放的激活转向

激活转向(Activation Steering)被广泛用于引导生成模型的行为,比如降低毒性输出。但现有方法普遍对所有输入施加同一套干预,一旦模型本身能正常作答,这种干预反而会损伤生成质量。
本文提出DSAS(Dynamically Scaled Activation Steering),一个与具体转向方法无关的框架,核心思路是把“何时转向”和“如何转向”拆开。DSAS在生成过程中为每个输入、每一层计算上下文相关的缩放因子,动态调整转向强度:只有检测到不良行为时才加大干预,其余情况保持轻干预。这个设计可以叠加到任意现有转向方法上,并且可以和转向函数一起端到端优化。
实验方面,DSAS与现有转向方法结合后,持续改善了Pareto front,即在不牺牲太多效用的情况下更有效地缓解毒性。作者还将DSAS应用到文本到图像扩散模型,验证了自适应转向能调制图像中的特定概念。最后,DSAS引入了极小的计算开销,同时提高了可解释性——它能明确告诉用户哪些token需要被转向、以及需要转向多少。
论文已被NeurIPS 2025的UniReps研讨会接收,代码将发布在GitHub上。


