ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

大模型术语黑话不再难懂:TPS、KV Cache、MTP 与 TP 到底是什么?club-3090 术语表完全指南

大模型术语黑话不再难懂:TPS、KV Cache、MTP 与 TP 到底是什么?club-3090 术语表完全指南 大模型术语黑话不再难懂TPS、KV Cache、MTP 与 TP 到底是什么club-3090 术语表完全指南【免费下载链接】club-3090Community recipes for serving LLMs on RTX 3090/4090/5090 CUDA gpus. Multi-engine (vLLM, llama.cpp, ik_llama) and model-agnostic. Currently shipping Qwen3.6-27B Qwen3.6 35B Gemma 4 26B Gemma 4 31B configs for 1× and 2× cards.项目地址: https://gitcode.com/gh_mirrors/cl/club-3090如果你打算在自己的显卡上跑大模型一定被一堆英文缩写劝退过TPS 是什么KV Cache 为什么吃显存MTP 和 TP 只差一个字母却完全是两码事别担心这篇文章带你一次讲透。club-3090 是一个面向RTX 3090/4090/5090等消费级 NVIDIA 显卡的开源社区项目提供多引擎vLLM、llama.cpp、SGLang、ik_llama的部署配方目前已开箱即用地支持 Qwen3.6-27B、Qwen3.6-35B、Gemma 4 26B、Gemma 4 31B 等模型的单卡与双卡配置。项目的官方术语表位于 docs/GLOSSARY.md是本文所有解释的权威出处。下面我们用大白话把这四个最高频的黑话逐个拆解开。一、TPS大模型界的车速表 ️TPS Tokens Per Second每秒生成的词元数就是模型打字速度。你可以把它理解成车速表~70 TPS接近流畅的对话速度~80–120 TPSChatGPT 云端的典型速度不过 TPS 家族还有三个表兄弟新手很容易混淆术语大白话TTFT(Time To First Token)从你按下回车到蹦出第一个字等了多久。长提示词会明显变慢Wall TPS输出词元数 ÷ 总耗时你真实体感到的整体速度含读提示词的时间Decode TPS去掉首字等待后的纯解码速度最能反映模型本身的打字功底另外还有个CV变异系数多次测量结果的波动幅度。波动小 数字可信。项目跑分要求 CV 5%见 docs/BENCH_CARD.md。单卡 3090 上实测的 Qwen3.6-27B 解码 TPS 大约长这样——带 MTP 的 long-text 配置达到 67 TPS已经很接近人类阅读速度了二、KV Cache模型的工作记忆显存最大的隐形杀手 先理解模型回答问题的两个阶段Prefill预填充模型把你发的全部输入系统提示词 历史对话 本次消息一口气读完然后才开始输出第一个字。这就是为什么长对话第一句总是慢。Decode解码之后逐个词元往外蹦字。而KV Cache键值缓存就是模型记住你这段对话的工作记忆上下文越长 → KV Cache 越大 → 占用显存越多。32K 上下文的 KV Cache 可能要多吃掉10GB 显存还是在模型权重之外的。这就是消费卡跑大模型的第一大矛盾24GB 显存要同时装下权重 KV Cache 激活值。下面这张图直观展示了单张 3090 上不同配置如何切分这 24GB两个省钱小技巧Prefix Cache前缀缓存两个请求共享同一段开头提示词时第二个请求直接复用缓存、跳过重复预填充。长文档、多轮 Agent 场景特别受益。KV 量化把 KV Cache 从 16-bit 压到 8-bit如fp8_e5m2甚至TQ3TurboQuant 3-bit。TQ3 能把 KV 池容量拉到 FP16 的约 5 倍在 24GB 单卡上塞进 192K 上下文——而 FP8 只能到约 32K。不同 KV 格式下262K 上下文的并发能力差距一目了然 项目里还有一个显存预算计算器 tools/kv-calc.py可以在启动前算出这个配置我的卡装不装得下原理文档见 docs/KV_MATH.md。三、MTP让模型一次猜好几个词的投机解码 MTP Multi-Token Prediction多词元预测是投机解码Speculative Decoding的一种Qwen3.6 系列模型原生自带。原理一句话模型先抢跑一口气猜 3 个词再回头验证——猜对了白赚猜错了就只保留对的部分。当接受率高时速度可以达到普通贪心解码的2–3 倍。相关黑话速查术语含义ALAcceptance Length接受长度平均每轮验证通过几个词。AL 3.5 每轮平均猜对 3–4 个Per-position acceptance第 1/2/3 个预测位各自的命中率比如 92% / 86% / 71%DFlash N5外挂的 5 词草稿模型替代内置 MTP面向 Qwen3.6 代码场景MTP head模型里负责打草稿的小子网络量化时需保留为 BF16 才能被 vLLM 使用下面这张判定矩阵展示了KV 压缩 MTP各种组合的质量验证结果绿色 健康橙色 退化红色 损坏——可以看到TQ3 KV MTP这一行几乎全绿质量 vs 并发的散点图更能说明问题TQ3MTP 组合右上紫色点在质量仅损失约 5 分的情况下把 262K 上下文下的最大并发拉到了别人的 2 倍以上四、TP和 MTP 只差一个字母含义完全不同 ️TP Tensor Parallelism张量并行是多卡部署的核心概念。TP2把模型每一层的权重同时切开分给两张卡两卡协同计算再通过 NCCL all-reduce 合并结果。效果是显存翻倍两张 24GB 48GB 可用。对比记忆PPPipeline Parallelism流水线并行是前几层放卡 A、后几层放卡 B本项目不使用。还有个隐藏知识点消费级显卡通常只有PCIe互联没有数据中心卡的NVLink~600 GB/sPCIe 上的 all-reduce 会慢 3–5 倍——但 club-3090 全程纯 PCIe 跑通无需 NVLink。双卡 3090 上 Qwen3.6-27B 的实测表现五、一页速查表 延伸阅读 黑话一句话解释TPS每秒生成词元数模型打字速度~70 即流畅对话速度KV Cache对话的工作记忆上下文越长越吃显存可量化压缩MTP内置多词元预测投机解码的一种猜对 3–4 词/轮提速 2–3 倍TP张量并行多卡把每层权重切开协同计算显存翻倍Prefill / Decode先读题后答题TTFT 由读题时间主导TQ33-bit KV 压缩格式KV 池容量约为 FP16 的 5 倍想深入这些是项目里最好的起点 完整术语表docs/GLOSSARY.md 新手友好入门硬件/引擎/量化如何搭配docs/LOCAL_AI_PRIMER.md KV Cache 显存预算数学docs/KV_MATH.md 各 GPU 架构下量化格式支持矩阵docs/DTYPE_MATRIX.md️ 双卡与多卡部署docs/MULTI_CARD.md、docs/PCIE_P2P.md 引擎原理对比docs/INFERENCE_ENGINES.md小结TPS 管速度KV Cache 管内存MTP 管投机加速TP 管多卡拆分。记住这四个你阅读任何大模型部署文档时的黑话密度都会骤降——剩下的交给 club-3090 的现成配置帮你落地。【免费下载链接】club-3090Community recipes for serving LLMs on RTX 3090/4090/5090 CUDA gpus. Multi-engine (vLLM, llama.cpp, ik_llama) and model-agnostic. Currently shipping Qwen3.6-27B Qwen3.6 35B Gemma 4 26B Gemma 4 31B configs for 1× and 2× cards.项目地址: https://gitcode.com/gh_mirrors/cl/club-3090创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表