面向 Qwen 系列模型线性注意力的高性能优化实践|AICon深圳 文章

InfoQ 中文2026-07-12BLOGzh作者: AICon 全球人工智能开发与应用大会

详细信息

来源站点
InfoQ 中文
作者
AICon 全球人工智能开发与应用大会
文章类型
BLOG
语言
zh
发布日期
2026-07-12

摘要

Agent 时代,哪些方向正在成为行业关键变量?50 + 实战案例揭晓答案!模型参数规模不断突破,推理成本持续下降,开源生态日益繁荣。当模型能力逐渐成为行业共识,一个新的问题开始浮现:当人人都能获得强大的模型能力之后,真正的竞争力还剩下什么? 答案正在从模型能力本身,转向围绕模型构建可规模化的智能系统;从单点能力提升,转向系统工程与组织级落地能力。在这一背景下,2026 年 AICon 人工智能开发与应用大会 · 深圳站"正式启动。本次大会将于 8 月 21 日—22 日举办,聚焦 AI 基础设施、大模型系统、智能体工程、数据智能、多模态技术与行业落地等关键方向,邀请来自腾讯、阿里、华为、百度、蚂蚁集团等 50 + 头部科技企业技术负责人、科研机构一线专家,系统性分享前沿洞察与实战干货,共同探讨 AI 技术从能力到系统、从实验到生产的真实路径。阿里巴巴Qwen 团队算法工程师章程瑞东已确认出席 “AI Infra、推理工程与异构计算"” 专题,并发表题为《面向 Qwen 系列模型线性注意力的高性能优化实践"》的主题分享。自 Qwen-3.5 采用混合注意力结构以来,Qwen 系列模型的线性注意力层 Gated Delta Network(GDN)在训练与推理中的开销日益显著。现有实现面临两大难题:一是多步算子需要反复读写 HBM,访存瓶颈严重;二是状态递推的串行性使算子并行度受限于注意力头数,在长序列、小 batch 或 TP 场景下 GPU 利用率低下。为此,他们提出 FlashQLA —— 基于 TileLang 的高性能线性注意力算子库。核心方案包括:将 GDN Chunked Prefill 的前向与反向流程各拆分为两个融合算子,通过数据复用降低访存开销,并在算子内通过 warp-specialization 实现不同计算的重叠;基于门控衰减的自动化卡内序列并行,并建立数学模型动态调节并行粒度;针对具有指数衰减特性的注意力头,舍弃昂贵的修正矩阵计算,改用轻量级预热获得精确状态。在 Hopper 显卡上,FlashQLA 相比 FLA Triton kernel 实现前向 2–3 倍、反向 2 倍加速,且在 TP 增大时加速比持续提升,显著优化了预训练与端侧推理效率。在本次演讲中,章程瑞东将对此展开详细介绍。