摘要
推理服务 HeteroFlow V2 提供完整的 GPU 推理服务管理能力,支持从模型发现到 API 服务的全自动化流程。通过 TaskGroup 统一管理推理服务生命周期,内置 OpenAI 兼容网关,实现一键部署和调用。 系统架构 ┌─────────────────────────────────────────────────────────────────────┐ │ 用户 / LLM 客户端 │ │ (浏览器 / curl / OpenAI SDK) │ └──────────┬──────────────────────────────────────────┬────────────────┘ │ Web UI (React + Vite) │ OpenAI API │ :5173 │ :3333/v1/chat/completions ┌──────────▼──────────────────────────────────────────▼────────────────┐ │ HeteroFlow Server (:3333) │ │ ┌────────────┐ ┌────────────┐ ┌──────────┐ ┌─────────────────┐ │ │ │ REST API │ │ Gateway │ │Scheduler │ │ Model Route │ │ │ │ /api/v1/* │ │ /v1/* │ │ │ │ Manager │ │ │ └─────┬──────┘ └─────┬──────┘ └────┬─────┘ └────────┬────────┘ │ │ │
摘要可能不完整,可查看原文