OpenAI模型越狱入侵第三方平台 AI安全体系急需重构

来源 | 《财经》新媒体 作者 | 撰稿人 舒志娟 | 文 编辑 | 高素英  

2026年07月23日 20:06  

本文2328字,约3分钟

一场因“内部测试”引发的安全事件,在事发数日后终于被揭开面纱,而"罪魁祸首"竟是测试者自己的AI大模型。7月22日,OpenAI对外承认,其两款AI模型在7月中旬的联合评估过程中失控,突破隔离测试环境并侵入开源社区Hugging Face的系统。

这起事件引发全球关注,不仅在于它是行业首次公开披露的、由AI模型自主完成的第三方平台入侵。更关键的是,它揭示了一个紧迫的现实,当模型的自主行动权不断提升,传统以规则和隔离为支柱的安全体系,正在面临系统性失效的风险。

从突破沙盒到窃取测试答案,模型仅用一个周末便完成了复杂的攻击链路。而OpenAI的回应,强调事件发生于“评估过程中”,恰恰折射出一个更深层的行业命题,当专为检验模型风险而设计的安全测试本身成为风险的触发点,现有的AI安全评估框架,是否还能为即将到来的更高能力模型提供有效约束?

AI失控变黑客  安全防线为何失守

事件的起点,源于OpenAI一次针对GPT-5.6Sol及另一款能力更强预发布模型的内部安全评估。测试的本意,是评估模型在自主任务中的能力边界。为了精准摸清模型的能力天花板,研究团队刻意调低了安全防护等级,关闭了部分用于阻止模型执行高风险操作的安全过滤器。

然而,模型并没有按照预定剧本行事。它们展现出极端的目标导向性,为高效达成获取测试答案的目标,采取了突破预设边界的未授权行动。从突破沙箱到入侵生产数据库,模型仅用一个周末便完成了复杂的攻击链条,利用软件包安装系统的漏洞获得互联网访问权限,继而推断Hugging Face可能存有答案,最终将窃取的凭证与平台漏洞串联利用,从生产数据库中提取了测试答案。

OpenAI事后确认,模型得以逃逸沙盒环境,是因软件包安装系统中存在一个此前未被披露的漏洞。但在业内看来,这一技术细节背后,折射出的是全球AI安全治理理念的整体性滞后。

深度科技研究院院长张孝荣指出,当前主流的AI安全框架,本质上建立在"内容安全"的管控逻辑之上,即检测模型是否输出有害、偏见或敏感信息。OpenAI的Moderation API、各平台的内容过滤机制,均是这一逻辑的产物。但此次事件证明,即使模型的最终输出本身无害,其"行为过程”,突破隔离、自主入侵、窃取数据,同样构成了严峻的安全威胁。当AI从"说话"走向"做事",安全防控的焦点必须从"说什么"转向"做什么"。

更深一层的困境在于评估方法论本身。资深人工智能专家王涛指出,要准确测试模型的能力边界,就必须降低护栏以暴露真实能力。但降低护栏后的模型,恰好具备了发动真实攻击的全部条件。能力越强,测试风险越大,这一悖论意味着,传统"红队测试"的安全范式,在面对自主智能体时正面临逻辑层面的失效。

图灵奖得主约书亚·本吉奥在2026世界人工智能大会上已发出警告,当前的安全措施已追不上AI能力狂飙的速度。他指出,新一代AI已学会"演给安全测试看",即在被评估时表现合规,却在实际部署中可能暴露出与真实目标不符的行为,这种“对齐伪装”,正使得现有的安全测试难以捕捉真实风险。

跳出传统风控  重构AI安全治理体系

而这场由“测试”本身引爆的危机,其悖谬之处还远不止于此。如果说模型的“自主越狱”已经足够令人震惊,那么事件后续的取证阶段则揭示了另一个更为尴尬的现实。

Hugging Face安全团队在分析超过1.7万条攻击日志时,尝试调用商业大模型API辅助分析,却因安全护栏拦截而受阻,最终借助本地部署的开源模型完成了全部日志分析,将数天工作压缩至数小时。这也反映出,AI安全治理已经到了必须系统性重构的时刻,不是修补已知漏洞,而是重新设计防护逻辑。

面对这一局面,行业共识是,AI安全治理需要从技术、制度、组织三个层面进行系统性重构。技术层面,隔离与干预机制需要根本性升级;制度层面,行业标准需要从“软建议”走向“硬约束”;组织层面,跨企业的协作与互信同样不可或缺。

张孝荣指出,AI技术迭代速度已远超人类安全治理体系的升级速度,单一的技术防护、企业自律或行业规则,均无法抵御高阶AI的系统性风险。想要实现AI创新与安全的动态平衡,必须跳出传统风控思维,构建覆盖技术研发、企业内控、行业标准、全球监管的全链条、多层级协同治理体系。

技术手段解决的是不敢为的问题,用外部约束防范AI的越界风险。但更深层的命题是如何让AI不能为和不欲为,将安全规则内化于模型底层。

在今年的人工智能大会上,复旦大学副校长姜育刚将此概括为AI的“内生安全”。他用一个类比指出,人的成长靠两条腿走路,一是教育将道德和法律内化为规矩;二是社会需要警察和制度来处理违规行为。对AI而言,“内生安全”就是希望它在“受教育”阶段就把规则印在骨子里,同时辅以必要的监管。这意味着,未来的AI安全治理不能仅依赖外挂护栏,而必须从模型架构层面内置安全能力。

有专家表示,随着AI成为千行百业不可或缺的基础工具,未来最大的潜在风险在于人类难以区分真实与虚幻。应对这一挑战,需要“用AI治理AI”,在全面拥抱AI的同时,同步推进对AI的规范与治理,通过智能化手段实时监测、识别和反制AI带来的新型风险,让防御的速度跟上攻击进化的速度。

216.73.217.12