ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

开源大模型私有化部署要几张卡?195 个模型的显存需求一览(2026 年 10 月)

开源大模型私有化部署要几张卡?195 个模型的显存需求一览(2026 年 10 月) 数据截至 2026 年 10 月 06 日。显存数字取自 vLLM 官方 recipesrecipes.vllm.ai标注的最低显存 卡数按「显存装得下」推算。完整数据和测算工具在 自建还是调 API — 大模型私有化部署成本测算 — ModelSage 每天自动同步。「DeepSeek 私有化部署要几张卡」「Qwen 本地部署需要多大显存」是企业做大模型落地时最常被问到的问题。网上答案很多但大多只讲一两个模型精度口径也不统一有的按 BF16 算有的按 INT4 算同一个模型能差 4 倍。这篇把 vLLM 官方 recipes 收录的 195 个开源模型整理到同一口径先给结论再给明细表。一、先看分布九成以上的模型一台 8 卡机器就够了按每个模型最省显存的那一档通常是 INT4 / FP4 量化统计8 卡 H200 都装不下的只有 7 个Kimi-K3、Kimi-K2-Instruct、Qwen3.8-2.4T-A95B、MiMo-V2.5-Pro以及 inclusionAI 的三款万亿参数模型Ring-2.6-1T、Ling-2.6-1T、Ring-1T-FP8。这些必须跨节点部署工程复杂度是另一个量级。需要说明单卡能装下的 86 个里有相当一部分是 OCR、语音、小尺寸模型。真正的旗舰对话模型基本都在「单机 8 卡」这一档。二、主流模型明细下表是企业最常问到的模型。「—」表示单机 8 卡装不下需要跨节点。几个值得注意的点1. 看总参数不要看激活参数。MoE 模型名字里带 A3B、A10B 这类后缀的推理时只激活一小部分参数所以速度快但全部专家权重都要放进显存。Qwen3.6-35B-A3B 每次只激活 3B显存却要按 35B 准备。2. 量化档位决定一半的预算。同一个 Qwen3.5-397BINT4 要 2 张 H200FP8 要 4 张。上线前先确认业务对量化后的精度损失是否可以接受这比比较卡价更重要。3. FP4 类格式要看卡的代际。表中 MXFP4 / NVFP4 这类 4-bit 浮点格式主要面向 Blackwell 架构B200、RTX 50 系、RTX PRO 6000。在老一代卡上能否运行、性能如何要以 vLLM 对具体模型的验证结果为准。4. 国产卡昇腾 910C 已有官方验证。vLLM recipes 中DeepSeek-V4-FlashINT8341 GB、Qwen3.6-27B、Qwen3-30B-A3B、Kimi-K3 等模型标注了昇腾 910C 的验证记录。有信创要求的项目可以优先从这些模型里选。三、这些数字是「下限」表中的卡数只回答「权重装不装得下」实际部署通常要更多KV Cache上下文越长、并发越高需要的额外显存越多。长文本、高并发场景要在此基础上预留余量。张量并行的约束多卡切分通常要求卡数是 2 的幂。算出来 3 张实际往往要上 4 张。跨节点通信超过 8 卡就要跨机器对网络IB / RoCE有要求成本和运维难度都会明显上升。四、买卡之前先算利用率显存只决定「能不能跑」「值不值得自己跑」取决于另一个数利用率。吞吐估错 30%自建成本差 30%利用率从 80% 掉到 10%自建成本差 8 倍。白天峰值买的算力夜里空转而 API 按 token 计费不用不花钱。很多企业自建亏钱不是因为卡慢而是因为卡闲。建议的判断顺序按上表确定模型和量化档位需要几张卡估算每天的 token 用量用卡的月租或折旧加运维开销算出「自建比调 API 划算」需要的最低利用率评估业务能否长期稳定跑到这个利用率。第 3 步的计算我们做成了一个在线工具选模型、量化档位和卡型输入日均 token 量和卡价直接给出盈亏平衡利用率并可以生成链接分享给同事。工具地址自建还是调 API — 大模型私有化部署成本测算 — ModelSage数据来源vLLM 官方 recipes显存与硬件验证整理于 2026 年 9 月 30 日。模型更新较快以工具页的最新数据为准。
返回列表