最高节省 85% 成本:微软公布 AI 智能体 LLM 路由方案 文章

InfoQ 中文2026-08-07BLOGzh作者: 作者:Claudio Masolo

详细信息

来源站点
InfoQ 中文
作者
作者:Claudio Masolo
文章类型
BLOG
语言
zh
发布日期
2026-08-07

摘要

Microsoft 发布了"一个用于在 Azure Kubernetes 服务"上路由智能体流量的参考架构。它将这个问题分解为三个关键选择:由哪个模型响应调用、如何管理调用,以及由哪个 GPU" 副本处理调用。该设计结合了用于负载均衡的 Kubernetes Gateway API Inference Extension"、作为 AI 代理的 agentgateway",以及用于语义路由的 RouteLLM"。这三者共同接入一个与 OpenAI 兼容的端点。其动机专门针对智能体工作负载,而非聊天。单个智能体任务可以在“规划—行动—观察”循环中发起数百次 LLM 调用,而其中大多数调用(填写工具参数、判断是或否、生成摘要)并不需要前沿模型。将每次调用都发送给顶级模型,会随着循环长度增加成本和延迟。简单的轮询负载均衡器甚至会让情况变得更糟。它可能会让一次生成 200 个 token 的请求排在繁忙 GPU Pod 上一个包含 10 万个 token 的预填充请求之后,而附近另一个空闲 Pod 却未被使用。路由智能体流量建议的架构完全按照信号来划分问题。RouteLLM 检查提示词,并预测成本更低的模型能否达到较强模型的回答质量。它使用一个基于人类偏好数据训练的矩阵分解路由器。Agentgateway 是一个可与 OpenAI 配合使用的开源代理。它负责管理身份验证、每个智能体的速率限制、成本跟踪和护栏等策略。它在完成这些工作的过程中不会检查提示词的含义。Gateway API Inference Extension 的 Endpoint Picker 会检查 GPU 的实时状态。它会查看 vLLM 的 KV 缓存占用率和队列深度。这有助于它决定由所选模型的哪个副本处理请求。对于自托管路径,Agentgateway 通过 ext-proc 直接调用 Endpoint Picker,使该设计能够完全绕过单独的 Gateway API 网关。KAITO" 按需提供 GPU 节点池并运行 vLLM。它会展示 vllm:num_requests_waiting 和 vllm:kv_cache_usage_perc 等指标,供 Endpoint Picker 使用。强模型路径通过 agentgateway 中的 AI 后端通向 Azure OpenAI。