GPT-Red:释放自我改进以提升鲁棒性

传统红队测试依赖人类专家,但面对日益复杂的AI系统,人工方式根本跑不赢模型能力迭代的速度。最尴尬的是,大量第三方数据(网页、邮件、工具调用)带来的prompt injection攻击已成常态,而现有安全评估早已被现有模型刷到饱和,发现新漏洞变成瓶颈。

OpenAI的解法很简单也很硬核:用AI来红队AI。他们训练了一个专门的自动红队模型GPT-Red,通过self-play强化学习与一群防守模型互搏——红队负责骗过防守方,防守方负责抵抗,双方在数不清的模拟场景里不断迭代。最关键的是,GPT-Red不是跑完评测就完事,而是直接嵌入生产模型的训练流程。结果很实在:GPT-5.6的prompt injection失败率比四个月前的最佳模型降低了6倍,直接攻击的成功率从95%以上暴跌到不足10%。

这项工作的真正价值在于它演示了一个安全自愈飞轮:用今天的模型去发现漏洞,再用这些漏洞去训练明天的模型,让明天的模型更安全。而且他们验证了鲁棒性提升并没有牺牲通用能力,模型该干活还是干活,只是对恶意指令更不听话了。这对整个行业来说是个清晰的信号——安全不能靠堆人力,必须靠自动化和对抗训练形成正循环。

GPT-Red: Unlocking Self-Improvement for Robustness

查看原文