ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Kairos-23M运维指南:用npu-smi监控芯片健康、功耗与温度的5个要点

Kairos-23M运维指南:用npu-smi监控芯片健康、功耗与温度的5个要点 Kairos-23M运维指南用npu-smi监控芯片健康、功耗与温度的5个要点【免费下载链接】kairos_23m-npu项目地址: https://ai.gitcode.com/atlasleong/kairos_23m-npuKairos-23M 是一个 2300 万参数的零样本时序预测基础模型time series foundation model完成昇腾AscendNPU 适配后可在 Ascend 910B4 芯片上输出 9 分位数预测结果。无论你是刚把模型跑起来的新手还是负责生产环境的运维工程师学会用 npu-smi 监控芯片健康、功耗与温度都是昇腾 NPU 运维的第一课。本文以 Kairos-23M 项目真实采集的 npu-smi 快照为依据提炼出 5 个核心监控要点帮你快速掌握芯片状态判读方法。图npu-smi 25.2.2 输出的芯片健康、功耗、温度与显存快照认识 npu-smi昇腾 NPU 运维的体检报告npu-smi 是昇腾 NPU 自带的设备管理工具可查看芯片健康状态Health、功耗Power、温度Temp、HBM 显存占用以及运行进程等关键信息。在 Kairos-23M 项目中物理机可见 8 个 Ascend 910B4-1 芯片编号 0–7推理入口使用逻辑设备npu:0由ASCEND_RT_VISIBLE_DEVICES0环境变量生效。运行以下命令即可查看全部芯片状态source /usr/local/Ascend/ascend-toolkit/set_env.sh npu-smi infonpu-smi 输出中最值得关注的字段如下表字段含义监控重点Health芯片健康状态必须为 OKPower(W)实时功耗是否与负载匹配Temp(C)芯片温度是否逼近告警线HBM-Usage高带宽显存占用是否接近上限Process_id运行进程任务落在哪张卡要点一用 npu-smi 检查芯片健康状态Health运维的第一步永远是确认卡还活着。npu-smi 输出中的 Health 字段直接给出芯片健康状态正常情况下显示 OK一旦出现异常应立即暂停推理任务并排查原因。在 Kairos-23M 的真实交付日志中npu-smi 25.2.2 的快照显示所有 910B4 芯片 HealthOK推理进程运行正常。建议把 Health 检查做成开机自检脚本并接入告警只要某张卡的 Health 不等于 OK就触发通知。这里有个运维细节要特别留意Kairos-23M 的推理入口inference.py严格禁止 CPU 回退——当torch.npu.is_available()返回 False 时脚本直接退出。这意味着芯片状态异常导致设备不可用时服务会立刻失败所以 Health 监控直接关系到服务可用性。✅要点二通过功耗Power判断负载是否正常功耗是判断 NPU 负载健康度的直观指标。npu-smi 的 Power(W) 字段显示芯片实时功耗结合 AICore 利用率一起看可快速判断负载是否正常推理高峰期功耗明显上升、AICore 利用率高正常现象空闲时功耗依然居高不下可能存在进程泄漏或散热异常满载时功耗反而偏低可能发生了降频或芯片性能退化。⚠️Kairos-23M 单次前向推理batch1、context_length512、prediction_length64的实测中位耗时为 113.94ms属于轻量推理负载。你可以用watch -n 5 npu-smi info持续刷新功耗曲线观察推理任务启动与结束时的功耗跳变快速定位异常波动。要点三紧盯温度Temp守住散热底线温度直接关系芯片寿命与性能稳定性。910B4 系列芯片工作温度较高在 Kairos-23M 项目的实测快照中部分芯片温度处于 110°C–128°C 区间说明满负荷推理下必须重视散热。温度监控有三个要点建立温度基线记录正常负载下的典型温度偏离基线超过阈值即告警关注降频保护芯片过热会自动降频保护表现为功耗与性能同时下滑排查散热链路温度持续偏高时检查机柜风道、风扇转速与机房空调。建议用循环采集的方式把温度写入日志方便事后回溯。例如每 5 秒抓取一次快照for i in $(seq 1 9); do npu-smi info npu_smi.txt; sleep 5; done这与 Kairos-23M 交付证据文件performance/npu_smi.txt的做法一致——项目正是通过 9 次连续 npu-smi 快照完整记录了推理期间的芯片健康、功耗、温度与显存变化。要点四监控 HBM 显存占用提前规避 OOMnpu-smi 输出中的 HBM-Usage 字段显示高带宽显存占用情况。在 Kairos-23M 实测快照中运行推理的芯片 HBM 占用约 28696MB / 65536MB留有充足余量。Kairos-23M 模型全程使用 float32 精度昇腾 910 不支持 fp64切勿改为 float64显存占用相对可控。运维建议记录常驻显存基线新版本发布后对比显存是否异常增长多任务共卡时预留足够 HBM 余量防止 OOM 拖垮同卡其他进程长期运行的服务定期重启释放显存碎片。要点五核对进程与多卡调度确认推理任务落在哪张芯片多卡机器上最怕以为跑在 A 卡实际占着 B 卡。npu-smi info 输出底部会列出各芯片上的运行进程Process_id 与显存占用。在 Kairos-23M 的交付记录中逻辑设备npu:0对应物理机上的 910B4 芯片进程信息与推理日志中的INPUT_DEVICEnpu:0、MODEL_DEVICEnpu:0、OUTPUT_DEVICEnpu:0完全对应。排查步骤很简单执行npu-smi info查看各卡进程列表确认自己的推理进程 PID 是否出现在目标芯片上出现 No running processes found 的芯片可以放心分配新任务。图Kairos-23M 在 npu:0 上完成推理验收EXIT_CODE0无 CPU 回退实战把 npu-smi 快照写进推理性能基线Kairos-23M 项目把 npu-smi 监控与性能测试结合了起来推理过程中采集 9 次 npu-smi 快照同时使用torch.npu.synchronize()做同步计时得到 median 113.94ms、p90 114.31ms 的稳定表现。这种性能数字 硬件状态的组合证据能在性能劣化时快速区分是模型问题还是硬件问题。建议你在自己的环境中同样建立双轨基线每次压测时同步采集 npu-smi 快照将健康状态、功耗、温度、显存与延迟一起存档。当延迟变差时先看硬件指标是否偏离基线再查代码变更事半功倍。相关文件参考项目交付说明README.md、推理入口inference.py、引导模块_job_bootstrap.py、模型配置model/config.json模型源码位于kairos_code/tsfm/model/kairos/目录。图Kairos-23M 从环境检查、模型推理到 NPU 验证的完整适配工作流运维小结一张表记住 5 个监控要点要点监控字段判断标准芯片健康Health必须为 OK负载判断Power(W) AICore与负载匹配无异常居高温度告警Temp(C)建立基线逼近上限即告警显存风险HBM-Usage预留余量防 OOM任务归属Process_id确认进程落在目标芯片掌握了这 5 个 npu-smi 监控要点你就能像老手一样快速读懂昇腾 NPU 的体检报告先看健康、再核功耗、盯紧温度、预留显存、确认卡位。把监控做在日常Kairos-23M 的时序预测服务才能跑得又稳又久。【免费下载链接】kairos_23m-npu项目地址: https://ai.gitcode.com/atlasleong/kairos_23m-npu创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表