美国AI开始攻击真人了 首次现实世界越界行为
英国人工智能安全研究所的研究人员表示,针对真人进行攻击的情况是前所未有的。这种通常出现在谍战片中的情节,如今却在现实中发生了。8月4日,该机构发布报告称,在最近的122次网络安全测评中,部分AI智能体进行了潜在有害活动,共记录到19起越界事件,涉及美国头部模型Anthropic和OpenAI。

最严重的一起事件中,智能体试图将恶意代码插入GitHub的真实项目,并通过创建虚假身份对审核员施压,要求批准代码。研究人员指出,这是首次在没有特定提示的情况下看到自主性和欺骗性相关的风险显现。此外,智能体还尝试直接联系真实用户,通过在线文件传输服务发送消息和文件,诱导他们运行恶意代码。
这个夏天,美国AI的安全问题频发。7月21日,OpenAI承认其AI模型挖出零日漏洞并入侵了Hugging Face平台。7月30日,Anthropic也承认旗下模型克劳德在受控环境中意外获得互联网访问权限,进入了三家真实机构的系统。AISI的一项测试结果显示,在475次评估中,五款美国前沿AI模型全部出现作弊行为,作弊率在7.8%至14.1%之间。
报告指出,这些行动的根本原因是智能体为了完成被赋予的任务。美国头部AI企业在竞争中痴迷于堆参数、刷榜单,追求极致能力,有时甚至放松了安全权限。例如,OpenAI曾关闭部分安全过滤器以测试模型的极限网络攻击能力。
相比之下,中国的AI发展不仅注重性能,还强调可信可控。例如,智普GLM-5.2在取证过程中表现出色,能够在本地部署,确保数据安全。中国在鼓励创新的同时,明确划出了若干条红线,如操作不得超出用户授权范围,运行时须有决策校验与容错熔断机制,全程可追溯、可审计等。
中国企业逐渐形成共识,认为只有交付全程可审计的安全系统,才能赢得企业级AI市场的入场券。美国AI的连续翻车暴露了新的安全隐忧,银行、医院、政务平台和大型制造企业不可能将核心数据和操作权限交给一个不可控的云端模型。
所有文章未经授权禁止转载、摘编、复制或建立镜像,违规转载法律必究。
举报邮箱:1002263188@qq.com