
Claude in Chrome 全面上市:安全防护与评估详情

Anthropic 宣布 Claude in Chrome 全面上市,所有付费 Claude 套餐均可使用。该扩展允许 Claude 在浏览器中自主执行操作,如阅读和输入文本、点击链接、导航页面和填写表单,并利用用户现有的登录信息。
为了应对提示注入攻击,Anthropic 在模型训练、分类器和运行时防护方面进行了多项改进:训练模型识别攻击、添加额外的分类器来审查网页内容,并在执行操作前验证操作是否与用户请求一致。评估显示,在最新的 Opus 和 Sonnet 模型上,配合防护措施,攻击成功率降至 0%,但 Opus 4.5 在无防护时仍有 17.6% 的成功率。
提示注入仍是持续挑战,Anthropic 将继续投资于自动化攻击发现和红队测试。企业管理员可通过组织设置管理该扩展,并限制为已批准的域名。


