
Nemotron部署实战指南vLLM/SGLang/TensorRT-LLM三大推理引擎Cookbook速查【免费下载链接】NemotronDeveloper Asset Hub for NVIDIA Nemotron — A one-stop resource for training recipes, usage cookbooks, datasets, and full end-to-end reference examples to build with Nemotron models项目地址: https://gitcode.com/gh_mirrors/ne/Nemotron想要完成Nemotron 部署却不知从何下手Nemotron 是 NVIDIA 开源的模型生态仓库usage-cookbook/ 目录内置了 vLLM、SGLang、TensorRT-LLM 三大推理引擎的官方部署 Cookbook覆盖从单卡跑 Nano 到多机部署 550B 大模型的完整路径。本文将带你速查这三套推理引擎 Cookbook 的核心流程从引擎选型、显存规划到工具调用与推理预算控制一次讲清楚帮你少走弯路 ⚡如何为 Nemotron 选推理引擎官方文档 docs/nemotron/omni3/inference.md 给出了一张非常实用的选型表三大引擎各有侧重引擎核心优势典型场景vLLM连续批处理、流式输出、生态最广泛通用推理服务、快速上手SGLang轻量、多智能体与工具调用体验好Agent 应用、轻量部署TensorRT-LLM延迟最低、MoE 隐式核优化生产环境、极致性能三者都支持 FP8 / NVFP4 量化与 Ampere 之后的主流 GPU。如果你的模型是 MoE 结构如 Nemotron-3 全系列张量并行TP和专家并行EP是关键部署概念上图展示张量并行如何将每层 MLP 的权重切分到多张 GPU 上。对于 MoE 模型TensorRT-LLM 还会启用专家并行把不同 Expert 放到不同 GPUNemotron-3-Nano单卡部署的最快路径入门首选Nemotron-3-Nano30B-A3B MoE显存门槛最低BF16 约需 64 GBFP8 约需 32 GBNVFP4 约需 20 GB。 官方 Notebookusage-cookbook/Nemotron-3-Nano/vllm_cookbook.ipynb部署流程只有四步安装依赖vLLM 对应量化的 CUDA 环境NVFP4 需 Blackwell 架构 CUDA 12.8验证 GPU确认 PyTorch 能识别 CUDA 设备进程内加载模型单条、批量、流式三种生成方式各试一遍启动 OpenAI 兼容服务器vllm serve一条命令即可对外提供 API支持工具调用--tool-call-parser qwen3_coder与推理解析--reasoning-parser nano_v3同样的流程也有 sglang_cookbook.ipynb 和 trtllm_cookbook.ipynb 两个引擎版本结构完全一致切换引擎几乎零成本。Nemotron-3-Super120B MoE 多卡部署速查Nemotron-3-Super120B-A12B是主力模型显存需求随精度档位变化明显精度显存需求参考配置vLLM 并行参数BF16≥ 264 GB4× H100--tensor-parallel-size 4FP8≥ 160 GB2× H100--tensor-parallel-size 2NVFP4≥ 80 GBB200Blackwell单卡即可尝试三个引擎的官方 Cookbook 都在这里vLLMusage-cookbook/Nemotron-3-Super/vllm_cookbook.ipynb —— 推荐开启--kv-cache-dtype fp8、--enable-chunked-prefill压低显存SGLangusage-cookbook/Nemotron-3-Super/sglang_cookbook.ipynb ——--tp 4/--tp 2对应 BF16 / FP8TensorRT-LLMusage-cookbook/Nemotron-3-Super/trtllm_cookbook.ipynb —— Docker 容器化部署--tp_size 4 --ep_size 4全专家并行延迟最低小贴士FP8 首次启动会比较慢内核 JIT 编译 autotune第二次启动会明显快很多别急着重启。Nemotron-3-Ultra550B 超大模型的多机部署与 AIPerf 压测Nemotron-3-Ultra550B-A55B即使压缩到 NVFP4 也无法单机容纳官方提供了基于 4× DGX Spark 集群的实战指南单机集群部署usage-cookbook/Nemotron-3-Ultra/SparkDeploymentGuide/README.md —— 用--tensor-parallel-size 4跨四台机器切分模型节点间走 ConnectX/RoCE 网络双工作站方案usage-cookbook/Nemotron-3-Ultra/DualStationDeploymentGuide/README.md单工作站方案usage-cookbook/Nemotron-3-Ultra/StationDeploymentGuide/README.md部署完成后官方用NVIDIA AIPerf做了完整压测首 Token 中位延迟约 2.05 秒输出吞吐约 20.55 tokens/sec/user进阶玩法工具调用与推理预算控制三大引擎的 Cookbook 都内置了OpenAI Tools 协议的工具调用演示部署后即可直接对接现有 Agent 框架更酷的是推理预算Reasoning Budget控制——通过reasoning_budget参数限制思考 Token 数在成本与推理深度之间自由权衡。仓库还提供了一个自定义 Logit Processor 工具包 tools/budget/可在服务端单次调用内完成预算截断配套的客户端示例见 tools/budget/client.py启动脚本见 tools/budget/serve_v3.sh。部署避坑清单⚠️NVFP4 只认 Blackwell 架构B200 / RTX PRO 6000Ampere/Hopper 请用 FP8⚠️ 进程内推理后起vllm serve会 OOM——先重启 kernel 释放 GPU 显存⚠️ 多机部署注意节点序号从 0 开始node1 对应 rank 0⚠️ 多卡环境确保 notebook 与终端在同一个虚拟环境中总结你的需求推荐路径单卡快速体验Nano vLLM Cookbook生产级高吞吐Super vLLMFP8, TP2Agent 工具调用Super SGLang极致低延迟Super/Ultra TensorRT-LLM消费级硬件跑超大模型Ultra 多机 Spark 集群仓库的 usage-cookbook/README.md 还收录了 NIM 微服务、Hugging Face Transformers、DGX Station 后训练等更多方向的部署与使用指南结合 docs/nemotron/omni3/inference.md 的引擎对照表从入门到生产都能找到对应方案。祝部署顺利 【免费下载链接】NemotronDeveloper Asset Hub for NVIDIA Nemotron — A one-stop resource for training recipes, usage cookbooks, datasets, and full end-to-end reference examples to build with Nemotron models项目地址: https://gitcode.com/gh_mirrors/ne/Nemotron创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考