行业资讯
统信UOS+沐曦C500 基于Ray集群多节点vLLM部署方案
基础环境组件规格/版本操作系统UOS V25 服务器操作系统服务器型号鲲鹏920AI 加速卡沐曦C500Docker 版本v24.0.9驱动安装请参考UOS V2500 沐曦驱动安装手册部署步骤在两个节点分别启动vllm容器# 拉取容器镜像# x86架构镜像dockerpull registry.uniontech.com/uos-ai/uos-server-25-metax-vllm:v0.20.0-maca.ai3.5.3.502-torch2.8-py312-x86_64# AArch64架构镜像dockerpull registry.uniontech.com/uos-ai/uos-server-25-metax-vllm:v0.11.0-aarch64# AArch64架构dockerrun-d\--privileged\--networkhost\--ipchost\--namevllm-openapi\--shm-size 100G\--ulimitmemlock-1\--ulimitnofile65535:65535\--device/dev/dri\--device/dev/mxcd\--device/dev/mem\--group-add video\--security-optseccompunconfined\--security-optapparmorunconfined\-eRAY_EXPERIMENTAL_NOSET_CUDA_VISIBLE_DEVICES1\-eNCCL_SOCKET_IFNAMEenp23s0f0\#指定网卡-eGLOO_SOCKET_IFNAMEenp23s0f0\#指定网卡-eVLLM_USE_MXGPU1\-eMACA_SMALL_PAGESIZE_ENABLE1\-eMACA_GRAPH_LAUNCH_MODE1\-v/home/models/:/models:ro\registry.uniontech.com/uos-ai/uos-server-25-metax-vllm:v0.11.0-aarch64\sleepinfinity部署ray集群# 进入容器服务dockerexec-itvllm-openapi /bin/bash# 在主节点先停止ray服务ray stop# 在主节点上启动 Ray 头节点指定端口 num-gpus 根据环境实际信息修改ray start--head--port6379--num-gpus1--node-ip-address10.10.18.25# 在子节点停止ray服务ray stop# 在子节点启动ray服务并加入集群ray start--address10.10.18.25:6379 --node-ip-address10.10.18.21 --num-gpus1# 查看集群信息ray status大模型测试部署vllm服务# 在head节点启动vllm服务vllm serve /models/DeepSeek-R1-Distill-Qwen-32B\--trust-remote-code\--tensor-parallel-size2\--max-num-seqs64\--enable-chunked-prefill\--host0.0.0.0\--gpu-memory-utilization0.8\--served-model-name deepseek\--distributed-executor-backend ray\--enforce-eager 服务启动成功截图✅ 服务验证发送测试请求curl-XPOST http://localhost:8000/v1/chat/completions\-HContent-Type: application/json\-d{ model: qwen3.5, messages: [{role: user, content: 你好请介绍一下自己}], temperature: 0.7, max_tokens: 200, stream: false } 预期返回 JSON 格式的模型回复
郑州网站建设
网页设计
企业官网