xAI 前工程师评现代 AI 领域最重要 Top3 开源项目 文章

开源中国2026-08-07NEWSzh作者:

详细信息

来源站点
开源中国
作者
文章类型
NEWS
语言
zh
发布日期
2026-08-07

摘要

Flash Attention 2 可能比我们所有人都活得久。 这句话不是来自某个技术博客,而是出自 Hieu Pham 的一条推文。Hieu Pham 是谁?他是 xAI 的早期工程师之一,在 Grok 训练基础设施团队工作过。近日他在 X 上发了一条帖子,列出了他认为现代 AI 领域最重要的三个开源项目。 第一个名字毫无悬念:Flash Attention 2。 Hieu 的理由很具体。FA 系列不需要解释,但 FA2 是他认为最重要的一个——复杂度恰到好处,刚好能驱动你去学 CuTe,但还没被那些"邪恶的" Hopper++ 优化所淹没,足够容易修改和适配。 更关键的是 FA2 的持久性。Hieu 说,他敢打赌世界上很多地方的人还在 Blackwell GPU 上跑 FA2,因为写出一个能击败 FA2 的 kernel 仍然太痛苦了。他引述了一位 kernel 大师的话:"FA-2 可能比我们所有人都活得久。" 这话听着夸张,但想想也合理。FA2 发布于 2023 年,三年过去,它仍然是大多数推理框架的默认注意力实现。一个 kernel 的寿命通常以月为单位,FA2 跨过了三代 GPU 架构,V100、A100、H100、B200 都能跑,而且性能不差。在 GPU kernel 这个领域,三年就是永恒。 第二个是 SGLang。 SGLang 是这两年崛起最快的推理框架之一。它的 RadixAttention 前缀缓存机制让它在 H100 上比 vLLM 高出 29% 的吞吐量。但 Hieu 对 SGLang 的感情很复杂——他直言有时厌倦了 SGLang 的代码复杂度,暗自希望 Mini-SGL 能够成为主流。但他随即补了一句:"然后我就从白日梦中醒来了。" 这个态度很真实。SGLang 近半年发展迅猛,但代码库的膨胀速度同样惊人。有社区成员在评论区提供了一组数据:SGLang 的 RadixAttention 在 H100 上比 vLLM 高出 29% 吞吐量,但 vLLM 的贡献者基数仍是 SGLang 的 3 倍。这种"性能领先但社区规模落后"的格局,也解释了为什么 Hieu 会希望有一个更轻量的 SGLang 替代品。