ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

P/D-Device: Disaggregated Large Language Model between Cloud and Devices

P/D-Device: Disaggregated Large Language Model between Cloud and Devices P/D-Device:云与设备间的解耦大语言模型研究总结与翻译一、文章主要内容本文聚焦大语言模型(LLM)在云-设备协同部署中的资源瓶颈问题,提出了名为P/D-Device的云-设备解耦协作方案,旨在同时解决云端资源长期占用导致吞吐量低、设备端资源有限导致首 token 延迟(TTFT)高的核心痛点,具体内容如下:1. 核心问题诊断云端瓶颈:LLM 解码阶段需生成大量 token,采用自回归生成方式,单请求占用解码实例时间长(如生成100个token需3秒,长文本任务甚至达数十秒),即使配备大量 NPU/GPU,吞吐量(TPS)仍受限于请求平均延迟。设备端瓶颈:设备端资源(计算、内存)有限,预填充阶段(compute-bound 阶段)的 TTFT 随提示词长度激增(如8k token 输入需数十秒),且无法维持 LLM 常驻实例;虽有滑动窗口注意力、量化等轻量化技术,但仍难以平衡延迟与性能。协同挑战:云-设备间传输中间数据(如 KVCache,常达 GB 级)面临实时性与数据量矛盾;现有推测性推理等协同方案需频繁通信,易受网络抖动影响,且未考虑长上下文场景下设备端预填充效率。2. P/D-Device 方案设计方案核心是仅在设备端预填充阶段让云端提供部分协助
返回列表