
后端人工智能模型推理服务集群管理可观测性【免费下载链接】gpustackA GPU cluster manager for high-performance AI model serving (vLLM, SGLang) and on-demand SSH-accessible GPU instances.项目地址https://gitcode.com/gh_mirrors/gp/gpustack点击查看免费下载本文面向需要把 GPUStack 托管的本地大模型能力接入 Dify 平台的开发者完整演示从 GPUStack 侧部署模型、创建 API Key到 Dify 侧安装 GPUStack 插件、配置系统模型再到在 Studio 与 Knowledge 中实际使用 LLM 对话、RAG 检索排序与 VLM 图像输入的全流程。读完本文你将掌握一套可复制的本地模型 Dify 应用搭建方案并理解其背后基于 OpenAI 兼容 API 与 Rerank API 的对接原理。Dify 可以借助 GPUStack 提供的能力使用本地部署的 LLM大语言模型、Embedding向量化、Reranking重排序、图像生成、语音转文本Speech-to-Text与文本转语音Text-to-Speech等模型能力。这套集成方案特别适合需要数据私密、成本可控、可离线运行 RAG 与智能体应用的场景。集成架构一览整个集成的数据流向非常简单清晰GPUStack 负责模型的部署与推理对外暴露统一的 HTTP 推理 APIOpenAI 兼容端点/v1与 Jina 兼容的/v1/rerank等Dify 通过官方 GPUStack 插件连接到 GPUStack 的 API 端点Dify 中的各类模型对话模型、Embedding 模型、Rerank 模型在运行时由 Dify 转发请求到 GPUStackGPUStack 再将其调度到具体的模型实例上执行。GPUStack 的 OpenAI 兼容 API 路由实现在 gpustack/routes/openai.py它把/v1下的一组端点如GET /v1/models、POST /v1/chat/completions、POST /v1/embeddings等统一代理到实际运行模型的 Worker 上并内置了基于权重的多实例负载均衡与流式响应支持。Dify 之所以能无缝接入正是因为 GPUStack 对外提供的协议与 OpenAI 标准接口兼容。第一步在 GPUStack 部署所需模型打开 GPUStack Web UI进入Deployments部署页面点击Deploy Model部署模型依次部署你需要的模型。以下是针对 Dify 集成场景的一组常用模型示例模型名称在 Dify 中的用途qwen3-8b对话/文本生成Chat Model用于 Studio 中的应用对话qwen2.5-vl-3b-instruct视觉语言模型Vision用于图片理解与多模态对话bge-m3Embedding 模型用于 Knowledge知识库中文档向量化bge-reranker-v2-m3Rerank 模型用于知识库检索结果的重排序部署完成后在模型的 Operations操作中找到API Access InfoAPI 访问信息这里会展示该模型对应的 API 端点地址、请求示例与认证方式是后续配置 Dify 时的关键参考信息。从源码看模型调用链路部署好的模型并不会在 GPUStack 内网凭空暴露给外部应用而是通过统一网关分发。以 OpenAI 兼容端点为例get_api_router() 会在/v1下注册models列表接口以及各推理端点请求进入后proxy_request_by_model 会完成以下工作校验调用者权限model_allowed_for_user根据请求体中的model字段解析对应的模型路由Model Route与其可用目标实例按权重随机选择一个运行中的目标实例对应LoadBalancer与ModelRouteTarget.weight的逻辑将请求代理转发到承载该模型实例的 Worker若请求要求stream: true则返回 SSE 流式响应。这意味着在 Dify 中配置好模型名与 API Key 后所有推理请求都会自动被 GPUStack 路由到正确的实例上无需关心底层实例分布。第二步创建 GPUStack API KeyDify 连接 GPUStack 需要一份具备推理权限的 API Key创建步骤如下在 GPUStack UI 中进入Access Control访问控制API Keys页面点击New API Key新建 API Key填写名称后点击Save保存复制生成的 API Key 并妥善保存供后续 Dify 配置使用。从源码实现看API Key 的生成与校验逻辑位于 gpustack/routes/api_keys.py 与 gpustack/api/auth.py密钥使用API_KEY_PREFIX前缀与generate_access_key/generate_secret_key生成见 gpustack/security.py请求时通过Authorization: Bearer api_key头HTTPBearer或X-API-Key头携带。Dify 插件在调用 GPUStack 时即使用该密钥完成身份认证。第三步在 Dify 中安装 GPUStack 插件进入 Dify UI点击右上角的PLUGINS插件选择Install from Marketplace从应用市场安装搜索 GPUStack 插件并点击安装。第四步在 Dify 中接入 GPUStack 模型插件安装完成后进入Settings Model Provider GPUStack设置 模型供应商 GPUStack点击Add Model添加模型填写以下字段Model Type模型类型根据模型的实际能力选择例如对话模型选 Chat、向量模型选 Embedding、重排序模型选 RerankModel Name模型名称必须与 GPUStack 上部署的模型名称完全一致例如qwen3-8b、bge-m3Server URL服务地址填写http://your-gpustack-url。注意两点不要使用localhost因为在 Dify 容器内localhost指向的是容器自身的内网无法访问宿主机上的 GPUStack如果 GPUStack 使用了自定义端口务必在 URL 中带上端口号并确保该地址能被 Dify 容器内部访问可以用curl验证连通性。API Key填入上一步从 GPUStack 复制的 API Key。填写完成后点击Save保存按需重复此步骤添加其他模型然后在System Model Settings系统模型设置中把刚添加的模型分别指定为默认的 Chat、Embedding 与 Rerank 模型并保存实战一在 Knowledge 中构建 RAG 知识库模型配置完成后即可在Studio工作台与Knowledge知识库中使用这些模型。以下是构建一个基于 RAG 的知识库问答应用的完整流程进入Knowledge创建一个知识库并上传你的文档资料配置 Chunk Settings分段设置与 Retrieval Settings检索设置。其中使用前面添加的Embedding 模型为文档内容生成向量索引使用Rerank 模型对检索命中的片段进行重排序提升最相关内容的排序优先级文档导入成功后进入Studio创建一个应用为该应用关联刚创建的知识库并选择对话模型如qwen3-8b即可开始交互问答。Rerank 能力背后的 API 支撑需要说明的是标准 OpenAI 兼容 API 并不包含rerank端点。GPUStack 专门提供了 Jina 兼容的 Rerank API 路径/v1/rerank实现在 gpustack/routes/rerank.py其请求模型包含model、query、documents与可选的top_n、return_documents字段响应则按index、document、relevance_score返回每个候选片段的排序得分。Dify 中的 Rerank 模型正是通过该端点工作从而在知识库检索阶段完成先召回、再精排的两阶段流程。更多接口细节可参考 Inference APIs 说明。实战二在 Studio 中对话与多模态输入完成知识库问答后还可以进一步体验多模态能力在 Studio 中把模型切换为视觉语言模型qwen2.5-vl-3b-instruct移除之前关联的知识库纯多模态对话场景通常不需要 RAG在应用设置中启用Vision视觉能力在对话输入框上传一张图片并发送模型即可读取图片内容进行多模态交互。常见问题与排查建议Server URL 连通性失败先确认 GPUStack 服务端口是否开放、防火墙是否放行再在 Dify 容器内执行curl http://your-gpustack-url/v1/models携带 API Key验证连通性避免使用localhost。模型名称不匹配Dify 中的 Model Name 必须与 GPUStack 部署名称严格一致GPUStack 通过请求体中的model字段解析路由名称不一致会直接导致Model not found错误见 proxy_request_by_model 中的 404 分支。模型未就绪若模型实例尚未完成启动状态非 RunningGPUStack 会返回无可用运行实例类错误对应 gpustack/routes/openai.py 的ServiceUnavailableException请等待实例就绪后重试。需要非 OpenAI 兼容 API若某个模型提供 OpenAI 之外的自定义 API可在 GPUStack 部署模型时开启Enable Generic Proxy功能通过/model/proxy/model_route_id/upstream-path路径式转发访问目标模型详细说明见 模型部署管理文档。至此你已经完成 GPUStack 与 Dify 的完整集成本地模型通过 OpenAI 兼容 API 供给 Dify知识库检索借助 Embedding Rerank 实现高质量 RAG多模态对话由 VLM 模型提供视觉理解能力整个过程数据保留在本地集群适合对隐私与成本敏感的 AI 应用场景。赞分享后端人工智能模型推理服务集群管理可观测性【免费下载链接】gpustackA GPU cluster manager for high-performance AI model serving (vLLM, SGLang) and on-demand SSH-accessible GPU instances.项目地址https://gitcode.com/gh_mirrors/gp/gpustack点击查看免费下载相关推荐将 Cherry Studio 接入 GPUStack本地 LLM、多模态与知识库 Embedding/Rerank 的完整集成指南将 Cherry Studio 接入 GPUStack本地 LLM、多模态与知识库 Embedding/Rerank 的完整集成指南 GPUStack 提供与后端人工智能模型推理服务集群管理可观测性GPUStack 与 OpenClaw 集成指南为本地个人 AI 助手接入 GPUStack 模型服务GPUStack 与 OpenClaw 集成指南为本地个人 AI 助手接入 GPUStack 模型服务 OpenClaw 是一款运行在本地设备上的个人 AI后端人工智能模型推理服务集群管理可观测性Vue Vben Admin 实战指南选一套 UI 框架十分钟跑起中后台Vue Vben Admin 实战指南选一套 UI 框架十分钟跑起中后台 Vue Vben Admin 是一套基于 Vue 3、TypeScript、Vit后端人工智能模型推理服务集群管理可观测性上一篇Firefox GNOME主题终极指南如何让浏览器完美融入桌面环境下一篇prek新手入门从安装到使用的完整教程创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考