面向 Agentic 负载的下一代 LLM 推理引擎设计实践|AICon深圳 文章

InfoQ 中文2026-07-14BLOGzh作者: AICon 全球人工智能开发与应用大会

详细信息

来源站点
InfoQ 中文
作者
AICon 全球人工智能开发与应用大会
文章类型
BLOG
语言
zh
发布日期
2026-07-14

摘要

Agent 时代,哪些方向正在成为行业关键变量?50 + 实战案例揭晓答案!模型参数规模不断突破,推理成本持续下降,开源生态日益繁荣。当模型能力逐渐成为行业共识,一个新的问题开始浮现:当人人都能获得强大的模型能力之后,真正的竞争力还剩下什么? 答案正在从模型能力本身,转向围绕模型构建可规模化的智能系统;从单点能力提升,转向系统工程与组织级落地能力。在这一背景下,2026 年 AICon 人工智能开发与应用大会 · 深圳站"正式启动。本次大会将于 8 月 21 日—22 日举办,聚焦 AI 基础设施、大模型系统、智能体工程、数据智能、多模态技术与行业落地等关键方向,邀请来自腾讯、阿里、华为、百度、蚂蚁集团等 50 + 头部科技企业技术负责人、科研机构一线专家,系统性分享前沿洞察与实战干货,共同探讨 AI 技术从能力到系统、从实验到生产的真实路径。阿里云高级开发工程师尚旭春已确认出席 “AI Infra、推理工程与异构计算"” 专题,并发表题为《面向 Agentic 负载的下一代 LLM 推理引擎设计实践"》的主题分享。随着 AI Agent 从 Demo 逐步走向生产环境,LLM 推理负载正在发生根本性变化。相比传统聊天场景,Agentic 工作负载具有高并发、短请求、多轮工具调用、逐 Token 生成等特点,推理引擎的优化目标也从追求极限吞吐,转向在保证低延迟的同时实现更高的 GPU Token 输出效率。本次分享将结合 TokenSpeed 的研发实践,从 Runtime 与 Kernel 两个层面介绍面向 Agentic 推理场景的新一代推理引擎设计。尚旭春,阿里云高级开发工程师,长期专注在大模型(LLM)软件栈在新硬件环境下的适配、性能调优与架构优化工作。在深耕工业界核心算力基础设施的同时,深度参与并活跃于顶尖的大模型开源基础设施(Infra)社区。作为 Mooncake 社区的 Maintainer,负责维护核心组件 Mooncake Store,该项目目前在 GitHub 上已获得超过 4k star;作为 SGLang 社区的 Committer,贡献了PD分离、流水线(PP)并行以及 HiCache 等多个提升长文本与高并发推理性能的核心特性;