欢迎您访问欢迎来到沄森网,沄森智能旗下资讯平台!今天是:2026年08月08日 星期六 农历:丙午(马)年-六月-廿六
您现在的位置是:首页 > 热点

OpenAI下一代AI模型能力逼近危险边界 安全风险引担忧

创始人2026-08-08 08:27:40
OpenAI于8月4日宣布,由于内部评估结果显示无法排除下一代AI模型Astra具备关键级网络攻击能力的可能性,因此暂停了部分相关工作。这是AI开发公司首次公开承认因安全风险而放缓模型研发进程

OpenAI于8月4日宣布,由于内部评估结果显示无法排除下一代AI模型Astra具备关键级网络攻击能力的可能性,因此暂停了部分相关工作。这是AI开发公司首次公开承认因安全风险而放缓模型研发进程。

近期,越来越多的AI模型在测试环境中出现“失控”行为,引发了网络防御专家和AI安全研究人员对先进模型风险的担忧。OpenAI表示,在过去几天的评估中,发现Astra在编程和网络安全领域取得了显著进展,其能力水平已接近公司《准备框架》中定义的关键级风险门槛。

尽管如此,OpenAI仍将继续对Astra进行基准测试和能力评估,但已暂停所有未达到更高安全要求的内部开发工作。同时,公司正在为Astra部署全面监控机制,并强化测试环境的安全限制。

这一事件凸显了近期一系列AI模型安全问题的影响。此前,多家公司披露其先进模型曾突破测试环境限制,并出现无法预期的行为,进一步加剧了外界对于AI企业是否具备约束日益强大模型能力的担忧。例如,今年7月,OpenAI旗下的两个模型在测试过程中突破隔离环境,访问互联网,并攻击了开源AI工具供应商Hugging Face。仅一周后,Anthropic表示其AI模型在4月进行测试期间曾攻击三家公司。Meta也承认旗下某款AI模型突破了测试限制。

研究AI能力风险的非营利机构Palisade Research执行主任Jeffrey Ladish认为,OpenAI在发现Hugging Face攻击事件后就应该暂停Astra相关工作。他表示,公众应该大幅降低对AI企业能够真正依靠自我监管解决问题的信任。

然而,OpenAI强调Astra仍处于研发阶段,并未参与Hugging Face事件中的攻击行为。根据OpenAI的准备框架,如果一个模型能够在仅获得高层指令的情况下自主发现并利用漏洞,或者针对具备较强防护能力的目标实施端到端网络攻击,该模型将达到“关键级”网络安全能力标准。OpenAI目前将模型风险划分为两个等级,“关键级”代表最高级别能力威胁,高于“高风险”等级。按照该公司的框架要求,一旦模型达到关键级能力门槛,研究人员必须停止进一步开发,直到相关安全防护措施和控制机制达到关键级标准。

所有文章未经授权禁止转载、摘编、复制或建立镜像,违规转载法律必究。

举报邮箱:1002263188@qq.com