在 vLLM Semantic Router 中使用 Microsoft Foundry 远程 Embedding 推理

1. 引言 在 vLLM Semantic Router 的设计中,Embedding 推理是驱动语义路由的核心信号之一。 官方教程已经演示了如何使用**远程 Embedding 推理提供商(Remote Embedding Providers)**替代本地 Embedding 推理服务: 👉 https://vllm-sr.ai/docs/tutorials/global/remote-embeddings/ 然而,在实际生产环境中,一个更为关键的问题随之而来: 如何使用企业级、可扩展的 Embedding 推理服务来支持语义路由? 本文基于官方教程中的场景,并结合 Microsoft Foundry Embedding 模型,演示如何构建一个具备以下特性的智能路由系统: 无需 GPU 无需在本地部署 Embedding 模型 生产就绪 2. 回顾:远程 Embedding 推理提供商 在 vLLM Semantic Router 中,路由器运行在 CPU 上,不依赖 GPU 推理能力。 通过远程 Embedding 推理提供商: 路由器 → 远程 Embedding 推理 API → 向量 我们可以: 将嵌入计算完全卸载到云服务 统一多模型的语义能力 解耦路由与推理 3. 教程场景(沿用官方测试场景) 在官方教程中,核心流程如下: 第 1 步:定义语义路由 routing: decisions: - name: math when: semantic_similarity: text: "math question" threshold: 0....

八月 3, 2026 · 2 分钟

让模型自己选模型:Embedding 驱动的 LLM 智能路由机制

在多模型并存的 AI 架构中(如 GPT-4 / GPT-4o / 轻量模型 / 垂直模型等),一个核心问题是: 如何在不显式指定模型 ID 的情况下,让系统自动选择最合适的模型? 本文介绍一种工程可落地的方案: 通过 Embedding 模型计算用户意图 → 在网关层进行语义匹配 → 动态路由到最合适的上游模型服务 我们将基于: Embedding 模型:Azure OpenAI text-embedding-3-small 网关:Envoy 核心机制:向量相似度打分 + 策略路由 问题背景与动机 在真实生产环境中,大模型调用通常面临几个挑战: 1. 成本与性能权衡 模型类型 优点 缺点 大模型(如 GPT-4) 能力强 成本高 / 延迟高 小模型(如 GPT-4o-mini) 快 / 便宜 能力有限 专用模型 精准 泛化弱 不同请求应该走不同模型,而不是“一刀切”。 2. 传统做法的局限 常见策略: 手动指定 model_id ❌(不智能) 基于规则(if/else)❌(不可扩展) 基于关键词匹配 ❌(语义不鲁棒) 3. 理想目标 我们希望: 用户只输入 prompt,系统自动理解“意图”,并选择最优模型 这正是 Embedding 可以发挥作用的地方。...

五月 26, 2026 · 2 分钟