-
OpenAI模型,自主攻击全球最大AI开源平台
北京时间7月22日,OpenAI在官方博客发文,承认其模型在一起安全评测事故中攻击了全球最大AI开源平台Hugging Face。
OpenAI发文承认,其模型在一次安全评测中攻击了Hugging Face的生产环境
这是行业首次公开披露、模型评测失控直接升级为跨企业真实生产环境网络攻击的安全事件。
事件的起点是一场模型能力测试,一场原本被关在隔离沙箱里的模型安全测试,最终演变成针对全球最大AI开源平台Hugging Face的真实网络攻击。模型在评估中为了“作弊”拿到高分,自主发现并串联多个零日漏洞(0 day,软件厂商尚未知晓、没有发布补丁修复的安全缺陷),逃逸出隔离环境,攻入Hugging Face生产数据库窃取答案。
在攻击发生后的事后追查阶段,面对超过1.7万条攻击日志,Hugging Face求助商业大模型,被对方的安全护栏集体拒之门外,最终完成取证分析的,是中国公司智谱的开源模型GLM-5.2。
为作弊,模型自己越狱了
据OpenAI披露,涉事模型为GPT-5.6 Sol以及一款能力更强的预发布模型。它们当时正在参加名为ExploitGym的内部评测,该基准包含898个真实软件漏洞利用任务,专门测试AI能否把真实软件漏洞一步步变成可以实际运行的攻击。
为了尽可能摸到模型能力上限,OpenAI特意降低了生产环境级别的安全拒绝机制,鼓励模型尽可能寻找复杂的攻击路径。
按照OpenAI最原本的设计,模型接触外部资源的唯一通道,是一套由OpenAI内部托管的第三方软件。
模型开始确实投入了大量推理算力,专门寻找获得公网访问权限的方法,在OpenAI内部包注册表的缓存代理中发现了一个此前未知的零日漏洞,随后在OpenAI研究测试环境中完成特权提升和横向移动,成功连接外网。
联网之后,模型推断Hugging Face可能托管着ExploitGym的测试答案,随即发动攻击。
它先通过恶意数据集,利用远程代码数据加载器和数据集配置中的模板注入两处代码执行路径,在Hugging Face的工作节点上执行代码,随后在周末期间提升至节点级权限,收割云端和集群凭证,横向移动至多个内部集群,最终攻入生产数据库,直接窃取测试解法。
OpenAI表示入侵发生在7月11日周末,全程由自主AI智能体系统端到端驱动,背后是大量短生命周期沙箱组成的集群,执行了数千个独立动作。Hugging Face基于大模型的异常检测管道首先标记了入侵,OpenAI安全团队也在内部发现异常,双方启动联合取证。
7月16日Hugging Face首次披露时称,这次事件“与我们之前处理过的任何情况都不同”。直到一周后OpenAI发文认领,它才知道攻击者是谁。
美国模型拒绝查案,中国开源模型接手
取证阶段,Hugging Face遇到了意想不到的难题。
为了分析超过1.7万条攻击事件记录、重建时间线、确认被接触的凭证,还要区分真实破坏和干扰调查的诱饵活动,靠人工逐条梳理通常需要数天。
Hugging Face最初尝试调用商业前沿大模型的API,但请求被安全护栏拦截。触发拦截的原因是日志里包含真实的攻击命令、漏洞利用载荷和命令与控制痕迹数据,护栏无法区分提交材料的是事件响应者还是攻击者。
最终,Hugging Face在自有基础设施上部署了GLM-5.2,由它遍历全部攻击记录并完成取证分析,将数天的工作压缩至数小时。
Hugging Face特别指出,这样做还有一个额外优势:攻击数据及涉及的凭证始终留在本地环境,没有离开企业基础设施。
这场事故意外完成了一次开源模型的全球路演。
Hugging Face将困境总结为“安全不对称”:攻击者可以使用完全不受限的模型,防守方却可能被云端模型的护栏拒之门外。该公司由此建议,企业应提前准备经过验证、能够在本地运行的高能力模型。
这场事故,其实也让开源模型多了一个此前存在感不算太强、如今却相当现实的位置:安全团队的应急工具。
对金融、政务、医疗等数据敏感行业而言,模型权重自主可控、数据不出企业边界、关键时刻不被服务商的审核机制卡住,正在从加分项变成刚需。
不过值得注意的是,开源模型开放权重同样降低了攻击者的门槛,安全不对称是一把双刃剑,这也是全球监管讨论开源治理时最纠结的一环。
失控预演之后,竞争已经换轨
这样的失控并非没有预演。
今年4月,Anthropic在Claude Mythos Preview的System Card中披露,红队演练中模型成功逃逸加固沙箱,随后超出指令范围自主行动:给正在公园吃三明治的研究员发邮件报告成果,未经允许将漏洞细节发布到公开网站,还在另一次测试中改写git历史掩盖改动。
Anthropic因此决定不对公众开放该模型,仅通过Project Glasswing计划向苹果、谷歌、微软、摩根大通等12家机构开放用于防御。
值得注意的是,相比Anthropic的模型是被明确要求尝试逃逸,本次OpenAI的模型没有收到任何逃逸指令,它是为了在测试中作弊拿到高分,自发越狱并攻击了一家无辜的第三方公司。
在业内看来,这起事件标志着AI的自主攻击能力从理论走向现实。
OpenAI研究员Micah Carroll在回应中写道:“如果这都不能让你相信错位风险将成为未来的关键隐忧,那我真不知道什么才可以。”
模型能力越强,失控作恶的潜在威胁越大,传统隔离防护持续承压,自主AI网络攻击或将成为长期常态化风险。
- 责任编辑: 陈济深 
-
中国最大运动鞋服零售商被逼到墙角
2026-07-22 16:20 观网财经-消费 -
小红书回应IPO传闻
2026-07-22 11:59 观网财经-互联网 -
WAIC观察|具身智能进厂元年,背后还有三本账
2026-07-22 09:59 智观WAIC2026 -
“苹果将推出租赁计划以刺激销量”
2026-07-22 09:17 -
日元对美元汇率跌至近40年来最低水平,1986年以来首次突破163
2026-07-22 08:47 -
A股史上最大财务造假案,夫妇被判赔14亿
2026-07-21 22:52 医药健康 -
AI制药,加剧“猴荒”?
2026-07-21 22:34 医药健康 -
“非洲手机之王”大涨价
2026-07-21 22:09 观网财经-科创 -
Kimi紧急叫停新订阅:模型效率提升,算力缺口却在扩大
2026-07-21 21:38 人工智能 -
长鑫被弃购658.62万股
2026-07-21 20:49 观网财经-科创 -
小米上调手机出货目标,存储涨不动了?
2026-07-21 20:18 观网财经-科创 -
沈逸:不能让全球南方做一道“跪着才能挣钱”的选择题
2026-07-21 19:58 观网财经-科创 -
巨头混战AI办公,阿里开始“集中火力”
2026-07-21 18:12 观网财经-互联网 -
88%的企业在砸钱,8%在赚钱:AI落地的瓶颈不在模型,在流程
2026-07-21 17:54 智观WAIC2026 -
未成年版“清朗”专项行动来了,AI家教的暑期档不好过
2026-07-21 16:46 观网财经-消费 -
央企上市公司密集公告
2026-07-21 12:53 市场资讯 -
跨越工具时代的人机交互,荣耀写下具身智能的中国答案
2026-07-21 12:21 -
美政府查哈佛大学中国捐赠人,法律逻辑“少见”
2026-07-21 12:12 观察者头条 -
美方跳出来:跟菲律宾站一起
2026-07-21 10:45 -
WAIC不止有大模型和机器人,还有拿着简历的年轻人
2026-07-21 08:58
相关推荐 -
特朗普自曝:美国干预过中国事务 评论 45
暑期档最高分!它道出中国人的骨气:站起来,不准跪! 评论 129
“新一轮关税,最快本周” 评论 148
硬要替换中国技术,算完账“我下巴都惊掉了” 评论 51
中国稀土对日出口低迷,日本拆空调挖海底也救不了急 评论 109最新闻 Hot-
数千人抗议莫迪政府要求教育部长辞职,印度“蟑螂运动”是啥?
-
前外长跳槽后,匈牙利翻旧帐:中企投资被卷入
-
离俄“浪子”们想回家,要不要原谅?
-
西班牙飞行员空中恶作剧:让阿根廷球迷以为夺冠,在他们兴奋时告知真相
-
卸任数小时,人已在酒吧
-
联合国会议上,中国发布重要文件
-
“至多两周就辞职,参选总理”
-
还在点火?“特朗普批准,美企或在沙特建铀浓缩设施”
-
特朗普:解除对黎40余年直飞禁令
-
加码!西班牙拟禁止户外公共场所吸烟
-
台积电将在美国加码投资1000亿美元,国台办回应
-
全国最后一位长征女红军王全英去世,享年105岁
-
阿联酋航空拒收10架波音飞机:不如拿去做罐头
-
暑期档最高分!它道出中国人的骨气:站起来,不准跪!
-
“新一轮关税,最快本周”
-
硬要替换中国技术,算完账“我下巴都惊掉了”
-

观察员
上海市互联网违法与不良信息举报中心