OpenAI与Anthropic的人工智能代理卷入新的安全漏洞事件

来源:新浪 #OpenAI# #AISI# #AI 安全#
662

英国人工智能安全研究所(AISI)周二披露,在对OpenAI和Anthropic模型进行测试时,发现一个AI代理通过创建虚假在线身份,未经授权访问了安全系统,此次测试揭露了一系列新的安全漏洞。

该研究所表示,在政府机构为评估这些模型能力而进行的安全评估过程中,由Anthropic的Mythos 5和OpenAI的GPT-5.6-Sol驱动的智能体实施了未经授权的行为。

“部分接受测试的智能代理针对真实个人和组织,进行了持续且可能造成危害的活动,”AISI在一篇博客文章中表示。

该报告凸显了智能体测试流程中安全防护措施的松懈,而人工智能公司却同时将智能体宣传为商业的未来。

AISI通过与主要实验室签订的自愿协议获得了先进AI模型的访问权限,并让这些智能体在虚构的网络安全场景中接受测试,以检验其能力。

该机构共进行了122次测试,并在总计10次测试运行中发现了19起未经授权的行为。其中17起由Anthropic的智能体引发,其余两起由OpenAI的智能体引发。

AISI表示,最恶劣的行为涉及一个智能体编写恶意代码并创建虚假在线身份,企图诱使人类批准该代码,并补充称,未发现任何违规行为导致实际危害。

虽然AISI并未透露是哪一个智能体制造了虚假身份,但此次违规行为与OpenAI此前自行披露的两起案例均不符。

加利福尼亚州非营利组织CivAI的研究员尹(Andrew Yoon)表示,该组织致力于研究人工智能的能力与风险,他认为此次事件似乎是由Anthropic的智能体所为。

“Mythos 采取了此类欺骗性行动,且显然明知自己针对的是真实的人,这一事实表明,Anthropic 对自身模型的掌控程度并不如他们所想的那样好,”Yoon 说道。

Anthropic在X平台的一份声明中表示,正与AISI密切合作以获取更多细节并开展独立调查。该公司尚未立即回应路透的置评请求。

OpenAI在公司博客文章中披露了相关细节,指出其智能体两次未经授权的行为均涉及以提示语所禁止的方式访问互联网。

“我们致力于与业界通力合作,加强安全开展高风险评估的共同实践,包括在未来几周内召集国家人工智能研究所、独立评估机构、其他人工智能实验室及相关团体等利益相关方,”OpenAI表示。

OpenAI还在其博客文章中披露了另一起事件:第三方测试提供商Irregular因配置错误,导致其智能体误连互联网。这与Anthropic上周关于配置错误的类似披露 (link) 如出一辙。

上周有报道称,OpenAI在发现其他智能体逃逸的证据后,已扩大了其黑客入侵调查范围。

与7月那起由OpenAI代理引发的AI公司Hugging Face安全漏洞事件不同,AISI评估中的代理并未从隔离的测试环境中逃逸并连接到互联网。AISI表示,该机构是根据标准测试程序允许其访问互联网的。

责编: 爱集微
来源:新浪 #OpenAI# #AISI# #AI 安全#
THE END
关闭
加载

PDF 加载中...