使用 Envoy AI Gateway 安装
本指南提供了在 Kubernetes 上将 vLLM Semantic Router 与 Envoy AI Gateway 集成的分步说明,以实现高级流量管理和 AI 特定功能。
对于大型请求体或 Semantic Router 返回的流式即时响应,另请参阅流式 ExtProc 与即时响应。该指南介绍了如何将 ExtProc 过滤器的请求体模式从 BUFFERED 切换为 STREAMED,以及流式 Chat Completions 客户端如何接收 looper 或 fast_response 的即时响应。
架构概览
部署包含以下组件:
- vLLM Semantic Router:提供智能请求路由和语义理解
- Envoy Gateway:核心网关功能和流量管理
- Envoy AI Gateway:基于 Envoy Gateway 构建的 LLM Provider AI Gateway