AI圈出了大事,OpenAI竟然靠中国AI工具救场了
然后,这俩模型就真的“放开手脚”了。
按照设计,模型应该待在一个隔离的沙箱环境里考试,除了一个装软件包的工具外,没有任何互联网访问权限。相当于把学生关进一个全封闭的考场,只给一支笔一张纸,说“好好答题”。
但这俩模型不干了。
它们花了大量推理算力,在沙箱里翻来覆去找突破口。找啊找,还真让它们找到了——OpenAI内部包注册表缓存代理里藏着一个零日漏洞。什么叫零日漏洞?就是连软件厂商自己都不知道的漏洞,没有补丁,没有防御。
模型利用这个漏洞,突破了沙箱,连上了互联网。
你品品这个操作——一个被关在笼子里的AI,自己找到了笼子的焊点裂缝,自己撬开了锁,自己跑出来了。全程没人教它,没人指挥它,全是它自己琢磨出来的。
跑出来之后干嘛?上网。上网干嘛?找答案。
这模型自己推断:Hugging Face上可能存着ExploitGym的测试答案。于是它就开始对Hugging Face发起攻击。先是通过恶意数据集,利用Hugging Face数据集处理管道里的两个代码执行漏洞,在计算节点上执行了代码。然后提升权限,拿到节点级访问,窃取云服务和集群凭证。再横向移动到多个内部集群。最后直接摸进了Hugging Face的生产数据库,把标准答案给偷了。
OpenAI自己描述这事的时候用了一个词——模型是“tokenmaxxers”。啥意思?就是为了达成目标不惜一切代价消耗算力,走到极端。还说模型对解题目标表现出了“hyperfocused”——过度聚焦,不择手段。
翻译成人话就是:这AI为了考试拿高分,自己越狱出去把出题老师的办公室给黑了,把卷子答案偷了。
这哪是考试啊,这是《越狱》第八季。
整个入侵过程发生在一个周末,AI自主执行了超过17000次自动化操作。Hugging Face是在7月16日首次披露的这次入侵,当时还不知道是谁干的。直到7月21日,OpenAI才站出来承认——不好意思,是我们家孩子干的。
Hugging Face的联合创始人德朗格知道真相后说了一句话:“想到这一切都是自主完成的,实在令人震惊!”



