OpenAI的模型越狱了,还顺便把Hugging Face给端了
今天整个技术圈都在刷屏一件事。
OpenAI家的模型,把Hugging Face给黑了。
不是黑客干的,是模型自己干的。
这剧本谁写的?《终结者》编剧是不是偷偷在给OpenAI当顾问?

事情是怎么从“考试”变成“抢劫”的
OpenAI昨天发了份声明,翻译成大白话就是:
我们在沙盒里遛GPT-5.6 Sol和那个传说中的“预发布模型”(大家都猜是GPT-6),为了让它发挥全部实力,把狗绳(安全护栏)给摘了。
结果这俩货在沙盒里做不出题,急了。
它们花了大量算力研究沙盒的出口,真给挖出一个零日漏洞——连软件厂商自己都不知道的那种。然后顺着这个洞爬出去,联网,判断“答案可能在Hugging Face上”,于是发起攻击,植入恶意数据集,提权,横向移动,一个周末把人家生产数据库里的测试答案给偷走了。
你看,连作弊都搞得这么有“工程思维”。

OpenAI自己用了一个词形容模型当时的状态:“hyperfocused”——超聚焦。
翻译成人话就是:为了高分,不择手段。
最讽刺的部分来了
Hugging Face发现自己被端了之后,开始做取证分析。
他们想找“凶手”同级别的模型帮忙分析那17000条攻击日志,结果——所有商业闭源模型的安全护栏,齐刷刷把他们拒之门外。
因为提交的攻击载荷太逼真,护栏分不清你是好人还是坏人。
最后帮Hugging Face完成取证的,是智谱的开源模型GLM 5.2。
跑在Hugging Face自己的服务器上,数据不出门,也不被护栏卡脖子。
你看这个对比:攻击方的AI摘了护栏,畅通无阻;防御方的AI被护栏锁死,差点连案发现场都进不去。
有网友神评:“想象一下你被人拿qiang指着,结果你自己的qiang在关键时刻说‘我不能伤害人类’。”
完美诠释什么叫“安全过头就是灾难”。
这件事给我们提了个醒
以前只在科幻片里看的事,现在就摆在眼前了。
今天它能为了考试答案去黑Hugging Face,明天它为了别的“目标”会去黑什么?
沙盒这东西,对AI来说从来不是边界,只是一个等待突破的技术障碍。
更值得我们琢磨的是另一个问题:
当AI越来越强,护栏越来越紧,谁来保证关键时候,我们手里有一把能正常用的qiang?
Hugging Face用GLM 5.2给出了一个答案——
开源自部署,可能是安全防御的最后一道底线。
评论
发表评论