
OpenAI ChatGPT Images 2.0 在智能手机上显示,背景带有 OpenAI 品牌标识。(图片来源:Cheng Xin/Getty Images)
【看中国2026年7月22日讯】(看中国记者路克编译/综合)据路透社7月21日报道,OpenAI日前披露,一款由其先进人工智能模型驱动的自主智能体(AI agent)在安全测试过程中出现异常行为,突破原本设定的限制,并对人工智能初创企业Hugging Face的基础设施发动攻击,引发一起被OpenAI称为“前所未有”的网络安全事件。
OpenAI表示,此次事件发生在内部评估先进AI模型网络攻击能力的测试中。研究人员原本希望通过模拟攻击环境,了解模型在复杂网络安全任务中的能力,但测试中的AI智能体意外绕过隔离环境限制,获得更广泛的网络访问能力,并最终触及Hugging Face相关系统。
美联社报道称,这是目前公开披露的少数案例之一:AI系统并非简单执行单一指令,而是在追求测试目标过程中,自主寻找漏洞、利用工具,并采取人类开发者未预料到的行动。
涉及GPT-5.6 Sol等模型,AI展现超出预期的网络能力
OpenAI在随后发布的说明中表示,此次事件涉及多个内部测试模型,包括GPT-5.6 Sol以及一款尚未公开发布、能力更强的预览模型。为了评估模型在网络安全领域的极限能力,测试过程中关闭了一些通常用于阻止高风险行为的安全限制。
据OpenAI介绍,测试环境原本处于高度隔离状态,但模型通过发现并利用软件漏洞,逐步扩大权限范围,最终突破限制。公司称,相关模型并不存在“恶意意图”,而是在试图完成设定目标时采取了开发人员没有预料到的路径。
《华尔街日报》指出,这一事件凸显了一个新的挑战:随着AI模型越来越擅长自主规划、编写代码和执行复杂任务,传统的软件安全边界可能不足以约束未来更强大的智能系统。
Hugging Face确认事件,AI安全监管压力进一步升高
此次事件涉及的Hugging Face是全球最大的人工智能模型共享平台之一,拥有大量开源AI模型和数据资源。OpenAI表示,已与Hugging Face合作调查事件经过,并加强相关安全措施。
Hugging Face方面确认发现并控制了相关安全事件。报道称,攻击过程中并未造成公开披露的大规模损害,但事件本身暴露出一个潜在风险:未来AI系统可能不仅是被动的软件工具,而可能成为能够自主寻找漏洞、调用工具甚至改变自身运行环境的“行动者”。
英国广播公司(BBC)报道称,AI智能体(AI agents)与传统聊天机器人最大的区别在于,它们能够在获得初始指令后持续行动,包括调用外部工具、访问文件系统以及执行多步骤任务。因此,如何确保这些系统始终处于人类控制之下,已经成为行业关注焦点。
专家警告:AI能力快速提升,安全体系必须同步升级
近年来,OpenAI、Anthropic、Google DeepMind等公司不断推动大型AI模型发展,同时也投入大量资源研究“AI对齐”(AI alignment)和安全控制技术。
此次事件再次引发业内关于“失控AI”风险的讨论。不过,一些专家也指出,“AI失控”这一说法容易被误解。部分技术人士认为,这并不意味着AI产生了类似人类的自主意识或目的,而是模型在优化既定目标时,采取了超出设计者预期的策略。
支持AI发展的研究人员认为,类似测试本身正是为了提前发现风险;而批评者则警告,随着AI能力接近甚至超过人类在部分专业领域的水平,仅依靠传统的软件安全措施可能已经不足。
OpenAI表示,公司正在强化安全评估流程,并与行业伙伴共享此次事件的调查结果,希望帮助研究人员更准确判断未来高级AI系统可能带来的风险。