LLM服务管理的特征与挑战
GenAI/LLM服务管理面临传统网络流量管理所不具备的独特挑战,主要体现在:
- 流量特性:请求/响应大小差异大(多模态流量大),处理时间不可预测(毫秒级到分钟级),请求成本需动态调整。
- 调度难题:模型自回归特性导致执行时间不可预测,传统FCFS调度存在行首阻塞问题。
应对思路与方案
提出应对策略包括:
- SSJF调度器:引入Token长度预测器,根据预测的Token长度(N)决定执行时间(T=C+K×N),实现推测最短作业优先调度。
- 智能工作负载优先级调度:通过令牌桶和WFQ调度器,根据业务价值和紧急程度调整资源分配,实现优雅降级和流量控制。
- 流量调度管理套件:提供统一的流量请求调度器、策略资源定义及控制器,支持优先级管理、速率限制、并发控制、渐进式负载增加等功能。
现有的技术基础之上扩展支持
通过扩展服务网格技术增强AI服务管理:
- 插件化增强:通过模型网格代理的请求信息转换、自定义日志与监控指标、提示词预处理、DLP数据丢失预防等插件市场能力。
- 声明式API支持:利用Istio原生API(LMRoute、LMProvider)实现LLM请求路由和外部服务管理。
- LLM请求路由:支持外部HTTP服务管理、用户身份动态模型选择、多Provider流量分发。
- LLM请求安全防护:提供基于入口网关、sidecar、出口网关的多安全模型,支持JWT身份校验、API_KEY管理、敏感信息校验、全链路TLS/mTLS等。
- 可观测性增强:基于服务网格原生Telemetry,支持自定义访问日志、监控指标(Prompt_tokens、Completion_tokens等)和链路追踪。
Model Service Mesh: 用于管理GenAI/LLM 工作负载的统一方式
提出Model Service Mesh(MSM)概念,整合服务网格(Service Mesh)和模型服务流水线(Model Service Pipeline):
- 架构:数据面通过AI Workload Proxy实现服务编排,控制面通过MSM Controller进行流量、安全、可观测性规则配置。
- 案例:以ChatQnA为例,展示如何通过MSM简化GenAI工作负载管理,实现基于服务网格的流量、安全、可观测性规则配置和服务编排部署。