摘要
模型的架构正在以超出工具链进化速度的方式膨胀,与此同时,国产算力的崛起让异构管理从可选项变成了必答题。那么,推理工程核心挑战如何破局?AI Infra 下一阶段技术演进方向在哪里? 近日,InfoQ《极客有约》X AICon 直播栏目特别邀请华为 AI 开源生态总监黄之鹏担任主持人,和Inferact vLLM committer 莫梓峰、范式智能(第四范式)系统研发专家杨守仁一起,在 AICon全球人工智能开发与应用大会(https://aicon.infoq.cn/2026/shanghai/track)2026 深圳站 即将召开之际,共同探讨 AI 基础设施从“可用”走向“高效可规模化”的关键路径。 部分精彩观点如下: 龙虾、Hermes 等 agent 开源项目,本质上就是把 CPU 的时钟借过来,让 Agent 有一个时间概念,但大模型本身还是没有时间概念。 软件工程屎山这个事情是所有人逃不开的,但现在可能确实有可能会逆转,软件不用越做越麻烦,模型的能力在越来越强。 代码现在没有那么值钱了,可能我们做的事情就是站在一个更高阶的 SRE 的角度:定义好 SLA、SLO、成本预算,剩下交给模型,那个时候做 Infra 可能会轻松一点。 以下内容基于直播速记整理,经 InfoQ 删减。 AI Infra 的挑战 黄之鹏:做 Infra 的同学都知道圈内有个笑话——“算法爷”,反正苦一苦 Infra,什么算法都能出来。各位认为,做 AI Infra 的挑战有哪些? 莫梓峰:现在 AI Infra 最大的挑战是模型架构越来越复杂、越来越多样化了。以前做 LLaMA 无非就是一个 dense model,transformer 加 MLP 就搞定了。后来 DeepSeek 出了 MoE,V1、V2 做 MoE,V3 开始又搞了个 index。到了 V4,我们花了快大半年去适配,因为它那个架构搞得特别复杂,尤其是 transformer 里 compress 那部分,光是 kernel 就写了几个月。至少 transformer 跟 MoE 这块是越来越复杂了。 而且我主要还是做多模态的。多模态的趋势也是越来越倾向全模态。
相关事件
暂无数据