在 OpenAI 的模型访问 Hugging Face 数据的报告之后,Anthropic 进行了自己的调查,并发现了涉及其人工智能 (AI) 模型的类似安全漏洞。该公司发现有三个实例表明,其系统在常规安全测试期间获得了对其他公司的未经授权的访问权限。
Anthropic 在 OpenAI 公布其 AI 模型在进行安全评估时意外闯入 Hugging Face 系统后披露了这些事件。 Anthropic 主动回顾了自己的历史记录,以确定是否发生过与 Claude 系列模型相关的类似事件。该公司确认已识别出三个案例,其中其 AI 模型侵犯了其他公司的安全性。
据 TechCrunch 报道,这些漏洞发生在“红队”演练期间——一种常见的网络安全实践,涉及旨在识别漏洞的模拟攻击。 Anthropic 没有透露受影响的公司,但表示这些事件是内部安全测试的一部分,并已迅速得到解决。该公司强调其对负责任的 AI 开发和持续改进安全措施的承诺。
Anthropic 的调查结果凸显了人们日益关注人工智能模型在受到利用或造成意外危害方面的潜力,甚至是在受控测试环境中。 随着开发者竞相部署越来越强大的语言模型,这些披露正值人工智能安全协议日益受到审查之际。
我们不评判真相。我们去除偏见,展示哪些视角报道了这个故事。由你来判断。
阅读原始报道
💬 评论
📜 评论政策