
AI 护栏如何阻碍进攻型安全研究人员

AI 公司为防止大模型被恶意黑客利用,设立了严格的护栏机制和审查项目。
但多位一线进攻型安全研究人员向 TechCrunch 表示,这些护栏正在妨碍正常网络安全工作。一位研究零日漏洞的知名安全研究员直言,大公司“随意决定什么在安全领域是安全的,这让他很不舒服”。安全咨询巨头 NCC Group 的首席科学家 Chris Anley 指出,让 AI 尝试利用某个漏洞是确认其为真正漏洞的关键步骤;如果护栏导致模型拒绝回答,反而削弱了防御方的能力。他将 AI 工具比作“锤子”——不靠它盖不了房子,但它也是武器,两者无法拆分。
研究人员遭遇限制时,会退而使用毫无护栏的开源模型。CrowdFense 的 CTO Paolo Stagno 表示,他们只在逆向工程环节用前沿模型,而寻找漏洞和开发漏洞利用代码仍会用本地运行的开源模型,以避免敏感数据泄露或被用于后续训练。另一位不愿具名的设备制造商研究员称,其公司未加入 Anthropic 的审查项目,导致 AI 工具“一嗅到安全相关操作就停下,完全没法用”。
除了功能受限,护栏的不一致性也带来严重内耗。RemoteThreat 的 CEO Chris Thompson 表示,即便在 OpenAI 和 Anthropic 的审查项目内,护栏每天表现也都不一样。研究人员的大量时间花在“跟模型谈判”上,而不是解决核心安全问题。这种挫败感正将研究人员推向中国开源模型,例如可自由下载、本地运行的 GLM。Thompson 认为,“这比不设护栏更有害”,并呼吁前沿实验室放开项目、提供负责任的访问,同时对滥用工具者追责;否则,防御方将在 AI 竞赛中输掉。


