
Abliteration.ai 把移除 AI 护栏做成了生意

一家名为 Abliteration.ai 的创业公司正在将开源大模型的“去护栏”操作商业化。该公司托管了去除安全限制的模型版本,用户可直接通过浏览器或 API 使用,无需自行下载和准备算力。其官方宣称目标是为“攻击性网络行动、红队测试和 Agent 测试”提供工具,核心逻辑是安全领域的老思路:无法复现的攻击行为就无法防御。
TechCrunch 的测试显示,该平台托管的 GLM-5.3(来自 Z.ai 的最新开源模型)去屑版能迅速编写偷窃 Chrome 密码的 Python 程序,以及在家培养危险病原体的详细方案。Abiliteration.ai 联合创始人 Devon(应其要求隐去姓氏)透露,公司尚未融资,靠客户收入支撑,已与多家主流云服务商建立合作。
这种操作引发了安全专家的担忧。AI 安全非营利组织 CivAI 的研究主管 Andrew Yoon 认为,去护栏让模型“变成反社会者”,几乎任何有害请求都会照办。但多数受访专家表示,这一趋势已无法阻止。Yoon 建议政府可以转而要求服务商部署分类器拦截有害内容,并对直接提供 GPU 租用的公司实施用户身份验证。
Abliteration.ai 自身提供可选的审核层,目前仅有少量基础防护(如测试中无法获得自杀指导)。创始人承认,划定公司责任边界的难题仍在解决中,尚未落实除信用卡记录外的 KYC 流程。
在网络安全行业内部,去护栏模型的实际价值存在分歧。一些 Agent 红队公司确认攻击者已经在私下使用这类模型,因此防御方需要同等工具;但另一些从业者指出,直接微调开源模型(本身已几乎无限制)更为常用。此外,去护栏过程可能损失模型的部分知识与能力,影响其在极端恶意场景下的有效性。多数公司认为,公开讨论与开放研究有助于更好地理解模型的实际风险边界。


