摘要
【导读】AI已经能纯手搓CUDA榨干GPU了!Fable 5狂飙18.7倍登顶,把GPT-5.5甩开4倍多。Anthropic联创直呼:RSI自我进化开始了。 AI竟写出了,史上最快内核! 在全新一轮GPU算子基准测试KernelBench-Mega中,Fable 5表现一骑绝尘。 它在RTX PRO 6000,全程「纯手搓」CUDA,速度狂飙18.7倍。 相比之下,强如Claude Opus 4.8也只跑出14.4倍,而GPT-5.5只有4.34倍。 Fable 5把第二名甩开了整整4倍多的身位,断层领先。 而给这件事下定论的,是Anthropic联合创始人Jack Clark。 他的判断只有一句话,这是「递归自我提升(RSI)循环」的开始。 Fable 5狂飙18.7倍,爆斩GPT-5.5 AI写出全球最快的底层代码,不仅速度碾压人类,甚至在代码的「纯度」上都做到了极致。 要知道,KernelBench-Mega绝不是什么普通的跑分基准。 它考的不再是对单一、孤立算子的修修补补,而是将一整个模型的计算块强行塞入内核,做深度的算子融合—— 这次的硬核考题是 02_kimi_linear_decode,一项 Kimi-Linear W4A16 的混合解码任务(4-bit 权重,bf16 激活)。 规则极其严苛:每个模型仅有一次自主会话的机会,以及3小时真实时间的极限压榨。 而Fable 5交出的这份成绩单,简直是将物理极限,直接拍在了对手脸上: Fable 5:18.71倍 Opus 4.8:14.4倍 GPT-5.5:4.34倍 Sonnet 5:4.0倍 更反直觉的是,上下文越长,它竟然跑得越快! 2K上下文时领17.8倍,8K时扩大到18.9倍,拉长到16K时,直接狂飙到了19.5倍。 要知道,随着上下文拉长,KV Cache必然膨胀,单Token的注意力计算量随之激增。 这通常是解码内核性能「大出血」的重灾区。 但Fable 5极其硬核地把所有计算强塞进「单次启动」(Kernel Launch)中,极大摊薄了固定的屏障同步开销;