摘要
作者 | 招商银行信息技术部 - 架构管理团队技术方向 | AI 基础设施、大模型推理优化大模型推理正在从单机走向分布式集群和分离式架构,但 Kubernetes 原生的工作负载原语(Deployment、StatefulSet)并不是为"多角色协作、拓扑敏感、快速和可靠升级、故障联动"的推理场景设计的。本文介绍招商银行基于 SGLang RBG 组件,在国产 AI 芯片上落地 DeepSeek-V4 Flash 大 EP 推理服务的实践,重点剖析动态端口分配、服务发现、多级故障自愈与原地升级四个核心机制的设计与实现。问题:DeepSeek-V4 国产 AI 芯片大 EP 部署的挑战当模型参数量达到数百 B 级别,单机已无法承载完整的推理计算。以 DeepSeek-V4 Flash 为例,它采用 MoE(Mixture of Experts)架构,专家参数分布在多张卡上通过 EP(Expert Parallelism)并行计算;同时,为了提升吞吐和降低延迟,业界通常将推理过程拆分为 Prefill(预填充)和 Decode(解码)两个阶段,分别由不同的实例组承担,再通过 Router 统一调度请求——这就是所谓的 PD 分离 + 大 EP 架构。这个架构在算法和系统层面已经成熟,但在基于 Kubernetes 纳管异构算力卡时,其部署与运维面临的工程化挑战,在复杂度上远超传统的无状态微服务。以下,我们将这些痛点按层次进行系统性剖析。多角色拓扑的配置复杂度大 EP 部署本质上是一个 三级嵌套的拓扑结构:最外层是角色(Router、Prefill、Decode),中间层是每个角色的多个实例(如 2 个 Prefill 实例组),最内层是每个实例内的多个 Worker Pod(如一个 Prefill 实例跨 16 张 AI 芯片,由 1 个 Leader + 15 个 Worker 组成)。传统 Kubernetes 的工作负载原语无法自然表达这种结构:Deployment 是无状态的,不支持 Pod 间的拓扑关系;StatefulSet 只管理单一角色的有序副本,无法表达跨角色的依赖。