ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

大模型与 vLLM 技术英文词汇表及学习材料

大模型与 vLLM 技术英文词汇表及学习材料 一、核心术语表中英对照一大模型基础架构英文术语中文翻译简要说明Large Language Model (LLM)大语言模型基于Transformer架构、在大量文本上训练的神经网络模型TransformerTransformer架构一种基于自注意力机制的神经网络架构用于NLP任务Attention Mechanism注意力机制让模型在处理序列时关注不同位置信息的技术Self-Attention自注意力序列中每个位置对所有位置进行注意力计算Feed-Forward Network (FFN)前馈网络Transformer中的全连接层Mixture of Experts (MoE)专家混合通过门控机制选择性激活部分参数的结构Parameters参数模型中的可学习权重和偏置Weights and Biases权重与偏置模型内部的数值参数Hidden States隐状态模型中间层的向量表示二推理与生成英文术语中文翻译简要说明Inference推理使用训练好的模型进行预测的过程Prompt提示词/输入提示给模型的初始文本或指令Prompt Phase / Prefill Phase预填充阶段模型处理输入提示的阶段Generation Phase / Decoding Phase生成阶段/解码阶段模型逐token生成输出的阶段Autoregressive自回归逐个生成token、依赖之前生成内容的生成方式Token标记/词元模型处理的最小文本单元Logits逻辑值模型输出的未归一化分数Temperature温度控制生成随机性的超参数Top-pTop-p采样基于累计概率的采样方法Beam Search束搜索保留多个候选序列的搜索算法Speculative Decoding投机解码使用小模型加速大模型生成的技术Guided Decoding引导式解码基于语法约束的logit修正技术三vLLM 核心概念英文术语中文翻译简要说明PagedAttention分页注意力vLLM的核心创新高效管理KV Cache的注意力算法KV CacheKV缓存缓存之前token的Key和Value向量避免重复计算Sequence序列表示一个客户端请求Context上下文序列中已生成的tokenBlock块KV Cache被分割成的固定大小内存块Block Size块大小每个块存储的token数量默认16Continuous Batching连续批处理动态调整批次大小提高GPU利用率Chunked Prefill分块预填充将长提示词分块处理的技术Automatic Prefix Caching自动前缀缓存缓存公共前缀的KV CacheCUDA GraphCUDA图捕获并重放CUDA内核序列以减少CPU开销四vLLM 系统组件英文术语中文翻译简要说明LLMEngineLLM引擎vLLM的核心引擎类负责请求处理和模型执行AsyncLLMEngine异步LLM引擎LLMEngine的异步封装用于在线服务Worker工作进程运行模型推理的进程通常每GPU一个Model Runner模型运行器负责加载和运行模型的对象Scheduler调度器决定每步处理哪些请求Entrypoint入口点vLLM的交互接口LLM类、API服务器等BlockPool块池KV Cache的物理内存管理单元Attention Backend注意力后端注意力机制的具体实现FlashAttention、FlashInfer等五分布式与量化英文术语中文翻译简要说明Tensor Parallelism (TP)张量并行将权重分片到多个GPUPipeline Parallelism (PP)流水线并行将模型层分片到多个GPUData Parallelism (DP)数据并行在不同设备上处理不同数据Expert Parallelism (EP)专家并行MoE模型中专家分布在多GPUQuantization量化减少模型参数精度以节省内存AWQAWQ量化一种权重量化方法GPTQGPTQ量化一种后训练量化方法FP8FP8精度8位浮点数格式六GPU编程术语vLLM内核相关英文术语中文翻译简要说明Warp线程束32个同时执行的线程Thread Block线程块可访问同一共享内存的线程组Grid网格线程块的集合Stream Multiprocessor (SM)流式多处理器GPU上的计算单元Shared Memory共享内存线程块内可访问的高速内存Global Memory全局内存GPU上的大容量内存Scalar_t标量类型数据的数值类型二、配套练习练习一术语填空中译英请将以下中文术语翻译为对应的英文大语言模型________________分页注意力________________KV缓存________________连续批处理________________张量并行________________自回归生成________________调度器________________量化________________线程束________________投机解码________________参考答案Large Language Model (LLM)PagedAttentionKV CacheContinuous BatchingTensor Parallelism (TP)Autoregressive GenerationSchedulerQuantizationWarpSpeculative Decoding练习二术语填空英译中请将以下英文术语翻译为对应的中文Prompt Phase________________Context________________Block________________Model Runner________________Attention Backend________________Logits________________Temperature________________Pipeline Parallelism________________Entrypoint________________CUDA Graph________________参考答案预填充阶段上下文块模型运行器注意力后端逻辑值温度流水线并行入口点CUDA图练习三阅读理解附英文原文及问题阅读以下关于 PagedAttention 的英文段落回答问题原文PagedAttention is vLLMs core innovation for efficient memory management during LLM inference. It enables high-throughput serving by storing attention keys and values in non-contiguous memory blocks, similar to how operating systems use virtual memory for process management. PagedAttention divides the KV cache into fixed-size blocks, allowing non-contiguous storage in GPU memory.QuestionsWhat is PagedAttention?How does PagedAttention store attention keys and values?What is the benefit of using PagedAttention?参考答案PagedAttention is vLLMs core innovation for efficient memory management during LLM inference.It stores attention keys and values in non-contiguous memory blocks.It enables high-throughput serving and allows non-contiguous storage in GPU memory.练习四句子翻译将以下英文句子翻译为中文The LLMEngine and AsyncLLMEngine classes are central to the functioning of the vLLM system, handling model inference and asynchronous request processing.A sequence represents a client request. The context consists of the generated tokens from the sequence.A warp is a group of 32 threads that execute simultaneously on a stream multiprocessor (SM).参考译文LLMEngine 和 AsyncLLMEngine 类是 vLLM 系统运行的核心负责处理模型推理和异步请求处理。序列表示一个客户端请求。上下文由序列中已生成的 token 组成。线程束是一组32个线程在流式多处理器SM上同时执行。三、推荐阅读材料一官方文档英文材料链接说明vLLM官方文档首页https://docs.vllm.ai完整的vLLM技术文档入口Architecture OverviewArchitecture Overview - vLLMvLLM架构概览理解系统设计Memory ManagementContributing to vLLM - vLLMPagedAttention和KV Cache管理详解Engine ArgumentsEngine Arguments - vLLM引擎参数完整参考Offline InferenceOffline Inference - vLLMLLM类离线推理使用指南二技术博客与论文材料链接说明Inside vLLM: Anatomy of a High-Throughput LLM Inference SystemInside vLLM: Anatomy of a High-Throughput LLM Inference System | vLLM Blog深入剖析vLLM的技术博客vLLM Paper (SOSP 2023)[2309.06180] Efficient Memory Management for Large Language Model Serving with PagedAttentionvLLM原始学术论文vLLM Announcing Bloghttps://blog.vllm.aiPagedAttention介绍博文三GitHub学习资源仓库链接说明llm-field-noteshttps://github.com/tomerjann/llm-field-notes从工程角度解释LLM术语llm-glossaryGitHub - holasoymalva/llm-glossary: Glossary of key concepts in Large Language Models (LLMs), Artificial Intelligence (AI), Natural Language Processing (NLP), and Machine Learning (ML). Clear definitions and resources for developers, researchers, and AI enthusiasts exploring generative language technologies. · GitHubLLM关键概念词汇表vllm_learnhttps://github.com/feiguangba/vllm_learn50课Jupyter练习册图解vLLM推理引擎llm-inference-engineeringhttps://github.com/amitshekhariitbhu/llm-inference-engineeringLLM推理工程逐步学习四社区与论坛资源链接说明vLLM Bloghttps://blog.vllm.ai官方技术博客vLLM Forumhttps://discuss.vllm.ai社区讨论论坛vLLM Slackhttps://slack.vllm.ai实时交流频道五推荐学习路径入门先阅读 vLLM 官方文档的 Quickstart Guide跑通一个简单的推理示例理解核心概念精读 Memory Management 文档理解 PagedAttention 和 KV Cache深入架构阅读 Architecture Overview理解 LLMEngine、Worker、Model Runner 等组件的关系动手实践使用 vllm_learn 的 Jupyter 练习册进行实验追踪前沿关注 vLLM Blog 和 GitHub了解最新特性和优化
返回列表