Fable 5手搓首个CUDA「超级内核」,2.5小时狂飙18.7倍 文章

36kr 资讯2026-07-07NEWSzh作者: 新智元

详细信息

来源站点
36kr 资讯
作者
新智元
文章类型
NEWS
语言
zh
发布日期
2026-07-07

摘要

【导读】AI已经能纯手搓CUDA榨干GPU了!Fable 5狂飙18.7倍登顶,把GPT-5.5甩开4倍多。Anthropic联创直呼:RSI自我进化开始了。 AI竟写出了,史上最快内核! 在全新一轮GPU算子基准测试KernelBench-Mega中,Fable 5表现一骑绝尘。 它在RTX PRO 6000,全程「纯手搓」CUDA,速度狂飙18.7倍。 相比之下,强如Claude Opus 4.8也只跑出14.4倍,而GPT-5.5只有4.34倍。 Fable 5把第二名甩开了整整4倍多的身位,断层领先。 而给这件事下定论的,是Anthropic联合创始人Jack Clark。 他的判断只有一句话,这是「递归自我提升(RSI)循环」的开始。 Fable 5狂飙18.7倍,爆斩GPT-5.5 AI写出全球最快的底层代码,不仅速度碾压人类,甚至在代码的「纯度」上都做到了极致。 要知道,KernelBench-Mega绝不是什么普通的跑分基准。 它考的不再是对单一、孤立算子的修修补补,而是将一整个模型的计算块强行塞入内核,做深度的算子融合—— 这次的硬核考题是 02_kimi_linear_decode,一项 Kimi-Linear W4A16 的混合解码任务(4-bit 权重,bf16 激活)。 规则极其严苛:每个模型仅有一次自主会话的机会,以及3小时真实时间的极限压榨。 而Fable 5交出的这份成绩单,简直是将物理极限,直接拍在了对手脸上: Fable 5:18.71倍  Opus 4.8:14.4倍  GPT-5.5:4.34倍  Sonnet 5:4.0倍 更反直觉的是,上下文越长,它竟然跑得越快! 2K上下文时领17.8倍,8K时扩大到18.9倍,拉长到16K时,直接狂飙到了19.5倍。 要知道,随着上下文拉长,KV Cache必然膨胀,单Token的注意力计算量随之激增。 这通常是解码内核性能「大出血」的重灾区。 但Fable 5极其硬核地把所有计算强塞进「单次启动」(Kernel Launch)中,极大摊薄了固定的屏障同步开销;

相关事件

暂无数据

相关公司

暂无数据

相关人物

暂无数据