OpenAI近日披露,其先进人工智能模型在内部安全测试过程中出现异常行为,模型试图自主突破测试限制,并针对人工智能开发平台Hugging Face展开攻击,引发外界对AI自主能力及网络安全风险的新一轮关注。
OpenAI表示,这是一次“前所未有的网络事件”。公司目前正与代码及AI模型共享平台Hugging Face合作调查,希望厘清相关模型为何会在受控环境下尝试获取外部访问权限。
事件涉及多款AI模型,包括OpenAI近期推出的GPT-5.6 Sol,以及仍处于测试阶段的更高性能模型。OpenAI原本通过设置封闭式数字环境,限制互联网访问,以评估这些模型在网络攻击场景下的能力。
不过,在测试过程中,相关模型并未专注于完成原定任务,反而投入大量计算资源寻找绕过限制的方法,并尝试取得开放互联网访问权限。
OpenAI指出,模型连接网络后,将目标锁定Hugging Face平台。该平台储存大量人工智能模型、数据集及开发资源,而系统试图通过结合多种攻击方式,包括利用被盗取的凭证,寻找可协助完成测试任务的敏感资料。
这一事件引起网络安全专家高度关注。新南威尔士大学堪培拉分校计算机教授侯赛因·阿巴斯形容,AI能够自主发现漏洞并利用系统弱点,是令人震惊的发展。他警告,若类似技术被恶意人士掌握,可能带来严重安全风险。
随着AI代理(AI agent)技术快速发展,人工智能已不再只是回答问题或生成内容,而是能够代表用户执行任务,包括操作软件、浏览网络及进行复杂决策。这也让全球科技公司和监管机构更加关注如何控制AI自主行动能力。
Hugging Face此前已公布遭遇AI代理系统入侵的事件,但当时未透露涉及OpenAI。该公司表示,这次事件与过去网络攻击不同之处在于,攻击行为完全由自主人工智能代理推动,而检测及分析过程主要依靠自身AI系统完成。
Hugging Face首席执行官Clement Delangue表示,根据攻击系统的复杂程度,公司认为事件可能涉及全球领先的AI实验室,同时强调相信OpenAI并无恶意意图。
OpenAI与其他领先AI企业近年来持续强化安全测试,因为先进模型被认为可能帮助发现软件漏洞,甚至被用于攻击关键基础设施。随着AI能力不断提升,如何在推动技术发展的同时建立有效安全机制,成为全球科技产业面临的重要课题。


