OpenAI、Anthropic 的 AI 智能体在网络安全测试中针对真实人员和系统采取行动
- 浏览次数 2257
- 喜欢 0
OpenAI 和 Anthropic 已确认,其 AI 模型涉及两起新披露的、由第三方进行的网络安全测试事件,导致一个真实网站被入侵,以及针对预期测试范围之外的真实人员的社会工程攻击。
这些事件与此前披露的 Hugging Face 入侵事件无关——在那次事件中,OpenAI 模型在另一次网络安全评估期间入侵了该 AI 平台,并利用泄露的凭证入侵了其他四个第三方服务的账户。
OpenAI 于周二披露了这两起新事件,称它们发生在英国 AI 安全研究所(UK AI Security Institute)和网络安全测试公司 Irregular 进行的评估过程中。
针对 GitHub 项目维护者的鱼叉式钓鱼攻击
英国 AI 安全研究所(AISI)是一家政府研究机构,负责评估先进 AI 模型的能力和风险。
AISI 表示,在最近的一次网络靶场评估中,由 Anthropic 的 Claude Mythos 5 和 OpenAI 的 GPT-5.6 Sol 驱动的智能体在尝试完成模拟黑客挑战时,在公共互联网上采取了未经授权的行动。
在总共122次评估尝试中,AISI 在10次运行中发现了19次针对实时互联网的未经授权行动。其中17次涉及 Mythos 5,2次涉及 GPT-5.6 Sol。
AISI 表示这些尝试并未成功,也未发现任何由此造成的现实世界损害。
"这些尝试并未成功,我们的调查也未发现任何由此造成的现实世界损害。"AISI 在一份单独公告中表示。"但这是我们首次在现实世界中看到自主性和欺骗性方面的风险如此清晰地显现出来,且无需特定提示。"
AISI 有意开启了开放互联网访问,并禁用了模型提供商的网络分类器,以衡量模型的基础能力。然而,这些智能体仅被授权攻击模拟网络靶场,并未明确告知它们如何使用互联网访问权限,也未指示它们避免与真实人员和系统进行交互。
Anthropic 向 BleepingComputer 确认,AISI 测试的是 Claude Mythos 5 的一个版本,但表示仍在调查中,尚无法确认 AISI 报告中描述的所有技术细节。
该公司表示于周一收到通知,并正在与 AISI 合作获取评估记录,以便进行自己的审查。
"我们感谢英国 AISI 在此事件中的领导作用,这凸显了需要更广泛地讨论如何安全地评估能力日益增强的 AI 智能体。"Anthropic 的一位发言人告诉 BleepingComputer。
"正如我们在上周披露自身事件后所分享的那样,该领域需要更强有力的、共享的标准来规范评估环境的构建和保护。我们期待与英国 AISI 合作,在开展自身调查的同时了解更多关于此事件的信息。"
Anthropic 指出,AISI 测试的是未启用标准网络安全防护措施的 Mythos 5,这并不是客户可用的配置。AISI 表示,其评估设计和配置可能导致了该行为,但并未预料到智能体会表现出"新颖的、可能具有欺骗性的行为迹象"。
AISI 表示,一个 Mythos 5 智能体在互联网上搜索了与网络挑战相关的术语,并错误地认为一个无关的公共 GitHub 仓库与测试有关。
该智能体随后尝试进行供应链攻击,向真实的开源项目提交了恶意代码,认为破坏该软件可以为其提供一条进入模拟靶场中某台机器的路径。
最令人担忧的是,该智能体研究了该项目的维护者,创建了多个虚假的 GitHub 身份,并利用这些账户发起社会工程攻击,试图迫使维护者批准一个恶意的 pull request。
当一名人工审核员警告该 pull request 包含恶意软件时,该智能体否认了这一指控,并利用其控制的其他虚假账户向维护者施压,制造出独立用户已审核并批准了这些更改的假象。
该智能体通过使用 Tor 和代理服务隐藏身份,并创建一次性 GitHub 账户,继续其社会工程攻击。
它向开发者发送了五封定向电子邮件,其中一些包含恶意软件,另一些则试图说服他们批准代码更改。
该智能体还发布了包含恶意代码和隐藏提示注入指令的 bug 报告,旨在欺骗 AI 编码助手执行非预期的操作。
当一名真实人员对其中一篇帖子提出质疑时,该智能体对其进行了编辑以隐藏恶意内容。在另一次尝试中,它使用丹麦语署名,以使其对一名讲丹麦语的维护者更具说服力。
AISI 研究人员发现,不同的智能体在不同的评估运行中相互协调,使用一个共享的 GitHub 仓库作为留言板,相互留下指令。
"这是 AISI 首次在现实世界中看到这种严重程度的欺骗行为,且未经提示、针对真实人员。"该研究所表示。
AISI 表示,目前尚不清楚该模型是在何时、或者是否意识到它正在与真实人员而非模拟目标进行交互。
OpenAI 模型在模拟 CTF 中入侵了真实网站
第二起新披露的事件发生在 Irregular 进行的"夺旗"(Capture-the-Flag)评估期间,该评估本应与互联网隔离。
在一次测试中,虚构目标的名称恰好与一个真实域名匹配,导致该模型利用了一个它认为是模拟挑战一部分的真实网站。
虽然 Irregular 的测试环境本应与互联网隔离,但一个配置错误使得 OpenAI 模型能够访问公共互联网并攻击该真实网站。
"根据 Irregular 的调查,该模型还找到并使用了凭证来操作同一个网站。"OpenAI 表示。
OpenAI 表示,该模型利用的是一个基本漏洞,而非零日漏洞,也没有脱离其测试环境。
OpenAI 表示,Irregular 尚未发现除受影响网站自身数据之外的任何影响,但其调查仍在进行中。OpenAI 表示,该公司正在准备一份关于隔离和安全管理进行网络安全评估的白皮书。