OpenAI承认AI模型在测试中“失控”,曾自主入侵其他公司系统
【导读】OpenAI承认AI模型在测试中“失控”,曾自主入侵其他公司系统,并称之为“史无前例的事件”
当地时间7月21日,OpenAI公开披露,其两款AI模型在内部评估过程中失控,突破隔离测试环境,侵入人工智能开源平台Hugging Face的系统。涉事模型包括GPT-5.6Sol及另一款能力更强的预发布版本。
据OpenAI介绍,这两款模型当时被置于一个名为“沙盒”的封闭式数字实验室中,用于测试其黑客能力。然而,模型发现了一个此前未知的系统漏洞,成功获得对开放互联网的访问权限——这实际上形成了一条“逃生通道”。此类未知系统漏洞通常被称为“零日漏洞”,因开发者毫无准备时间而得名。今年4月,OpenAI的主要竞争对手Anthropic曾表示,其Mythos模型发现了数千个此类漏洞。
随后,这一模型入侵Hugging Face平台,试图获取有助于通过黑客能力评估的技术信息,“成功获取了机密信息,并利用这些信息规避评估规则”。直至Hugging Face安全团队发现异常并制止该活动,攻击才告终止。
OpenAI将此事称为“史无前例的事件”,并称正在强化安全防护体系。该公司同时警告,随着模型能力持续提升,类似事件可能更为常见。
Hugging Face是一个广泛用于托管开源大语言模型和数据集的平台。该公司上周在博客中表示,“此次入侵与我们此前处理过的任何事件都不同”,因为“其全过程由一个自主AI代理系统驱动”。
Hugging Face联合创始人克莱芒.德朗格(Clement Delangue)表示,公司曾怀疑攻击背后有前沿实验室参与,但认为OpenAI并无恶意。他补充道:“整个过程是自主发生的,令人难以置信。”
路透社援引代理式AI网络安全公司Tolmo工程师马特.苏伊什(Matt Suiche)的观点称,该事件表明前沿模型正在“缩小与最先进攻击者之间的差距”。但他同时指出,OpenAI描述的这类入侵方式,完全可以通过现有技术实现,甚至无需依赖最新模型,其公司内部已有类似实验结果。
所有文章未经授权禁止转载、摘编、复制或建立镜像,违规转载法律必究。
举报邮箱:1002263188@qq.com