摘要
真行,ChatGPT下一代模型还没发布,人家先把Hugging Face黑了…… 而且这AI费尽心思逃出测试环境、寻找漏洞、窃取凭证,最终目的居然只是—— 偷!评!测!答!案! OpenAI刚刚公开认领了一起《重大》安全事故。 GPT-5.6 Sol与一款能力更强的未发布模型,在接受网络安全测试,成功逃出了内部隔离环境,一路闯进了Hugging Face的生产系统。 然后,更戏剧性的一幕来了—— 调查入侵路径时,原本找来帮忙的商业模型掉链子搞不定,团队实在没招了,最终接手查案的反倒成了GLM-5.2??? 超过1.7万条的攻击记录,就这么让一个本地部署的开源模型一口气拿下了…… 这下好了,OpenAI模型负责黑,GLM负责查。 家人们,只能说这出AI版《猫鼠游戏》的大戏,还是太有节目效果了…… 为找评测答案,模型自己越狱上网了 如此魔幻,如此抓马的事故起点,源自OpenAI内部进行的一次「网络安全能力」评测。 模型参加的项目名叫ExploitGym,专门测试AI能否把真实软件漏洞,一步步变成可以实际运行的攻击。 整套评测包含898个任务,每道题会提供存在漏洞的程序、能够触发问题的输入和相应运行环境,再让Agent自行分析漏洞、构造攻击,最终拿到藏在环境里的Flag!!! emm…其实就是把AI关进一座网络靶场,看看它到底有多会「黑」。 而参加本次评测的选手,则包括GPT-5.6 Sol,以及OpenAI一款能力更强的未发布模型。 (这个模型到底是啥捏,真的好难猜啊…) 为了尽可能摸到模型能力上限,OpenAI还主动放宽安全护栏,鼓励模型尽可能寻找复杂的攻击路径~ 按照OpenAI最原本的设计,模型接触外部资源的唯一通道,是一套由OpenAI内部托管的第三方软件。 它的身份是充当软件包注册中心的代理与缓存,让模型能够安装完成任务所需的程序包。 然鹅吧,这模型显然没打算老老实实待在考场里。(doge) 模型开始确实投入了大量推理算力,专门寻找获得公网访问权限的方法。 但找着找着,还真让人家在缓存代理中发现了一个此前未知的「零日漏洞」。 所谓零日漏洞,指厂商尚未发现、也没有现成补丁的安全缺陷,对于攻击者来说,这类漏洞往往意味着一扇暂时无人设防的门。