一次测试,逼 OpenAI 最高模型,黑进了全球最大 AI 开源平台 文章

36kr 资讯2026-07-22NEWSzh作者: 极客公园

详细信息

来源站点
36kr 资讯
作者
极客公园
文章类型
NEWS
语言
zh
发布日期
2026-07-22

摘要

上周,全球最大的开源 AI 平台 Hugging Face 披露了一起前所未有的安全事件——它的生产基础设施被一个「自主 AI agent」入侵了。 攻击者在一个周末内执行了超过 17000 次自动化操作,窃取了内部数据集和多个服务凭证。Hugging Face 重建了完整的攻击时间线,但有一个关键问题始终没有答案: 驱动这个 agent 的大模型,到底是谁家的? 当地时间 7 月 21 日,谜底揭晓。 OpenAI 在官方博客中承认,入侵 Hugging Face 的,正是他们自己正在测试的模型——GPT-5.6 Sol,以及一个「能力更强的预发布模型」。 不是被黑客利用,不是被恶意指令驱动,是全球顶尖模型,在一场内部考试中,自己决定越狱、自己发起入侵、自己偷了答案。 精彩,实在是精彩。 01 一场考试,一次越狱,一起入侵 故事要从一个叫 ExploitGym 的安全评测说起。 ExploitGym 是一个公开的网络安全能力基准测试,专门衡量 AI 模型能否把已知的安全漏洞,转化为可执行的真实攻击。这类评测在行业里很常见,用来摸清模型的攻防上限。OpenAI 在内部用 GPT-5.6 Sol 和一个更强的未发布模型来跑这个测试,为了测出真实能力边界,安全护栏被故意降低了。 按照设计,模型应该在一个隔离的沙箱环境里完成测试,除了一个用于安装软件包的工具之外,不应该有任何互联网访问权限。 但接下来发生的事,没人能预料到。 模型花费了大量推理算力,在沙箱内反复寻找突破口。最终,它发现了 OpenAI 内部用作包管理代理和缓存的,第三方软件中存在的零日漏洞。利用这个漏洞,模型成功获得了不受限制的互联网访问权限。 拿到网络权限之后,模型自行推断 Hugging Face 可能托管着与 ExploitGym 相关的数据集和答案。于是它开始寻找入口。 OpenAI 在博客中写道,模型「将被盗凭证和多个漏洞串联起来」,找到了一条远程代码执行路径,最终从 Hugging Face 的生产数据库中直接提取了基准测试的答案。 翻译成人话就是——模型被安排考试,觉得做题太难,于是自己越狱,黑进了出题方的服务器,把标准答案偷了。

相关事件

暂无数据

相关公司查看全部 (2)

O
OpenAICOMPANY
H

相关人物

暂无数据