ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Agent Lightning 安装 verl GPU 训练栈时 verl 版本与 CUDA 组合怎么选?

Agent Lightning 安装 verl GPU 训练栈时 verl 版本与 CUDA 组合怎么选? Agent Lightning 安装 verl GPU 训练栈时 verl 版本与 CUDA 组合怎么选【免费下载链接】agent-lightningThe absolute trainer to light up AI agents.项目地址: https://gitcode.com/GitHub_Trending/ag/agent-lightning在 Agent Lightning v1.0 的单节点安装流程中安装指南 的 Step 2 要求执行bash scripts/setup_verl.sh verl版本 CUDA变体。如果参数传错脚本会直接报错退出传对了但耗时和依赖关系不清楚也容易中途放弃。这篇文章只解决一个问题如何根据你的机器环境选对verl版本与 CUDA wheel 变体的组合并完整跑通 GPU 训练栈安装。先确认两个前提安装指南给出的前置条件只有两条已安装uv和 NVIDIA CUDA受支持的 CUDA 版本为12.9或13.0已从项目根目录执行过uv sync项目基础 Python 环境已装入.venv项目 pyproject.toml 要求 Python3.12。setup_verl.sh不会替你建环境它默认使用.venv/bin/python如果该可执行文件不存在脚本会直接报ERROR: expected Python executable not found并提示先运行uv sync。所以第一步永远是cd this-repo uv sync组合怎么选CUDA 版本定变体官方推荐 verl 0.8.0setup_verl.sh 的参数格式为bash scripts/setup_verl.sh 0.7.1|0.8.0 cu129|cu130 [venv_path]三个位置的取值规则都来自文档参数可选值由什么决定verl版本0.7.1或0.8.0脚本只接受这两个值否则打印 usage 并以退出码 1 结束CUDA wheel 变体cu129或cu130与机器上已安装的 CUDA 版本对应CUDA 12.9 用cu129CUDA 13.0 用cu130venv_path可选默认.venv仅当你的环境不在项目根目录.venv时传第三个参数README.md 给出的示例安装就是在 CUDA 13.0 机器上使用bash scripts/setup_verl.sh 0.8.0 cu130与安装指南中We recommend CUDA 13.0 with verl0.8.0的推荐一致。因此选型结论是CUDA 13.0 机器首选0.8.0 cu130官方推荐组合CUDA 12.9 机器使用0.7.1 cu129。两个verl版本对应的 vLLM 版本不同脚本内部已固定不需要你另外指定verl0.7.1路径安装vllm0.12.0与verl同一条命令装verl0.8.0路径先装vllm0.20.2再装verl0.8.0。两条路径都会在所选环境中本地编译flash-attn2.8.3。选这套脚本而不是手动pip install的原因也是文档明确的verl、vllm、torch的兼容版本 tightly coupled且flash-attn安装容易出错脚本装的是经过测试、版本锁定的组合。执行安装确认机器 CUDA 版本后例如nvcc --version激活基础环境并运行脚本source .venv/bin/activate bash scripts/setup_verl.sh 0.8.0 cu130或 CUDA 12.9 环境source .venv/bin/activate bash scripts/setup_verl.sh 0.7.1 cu129执行时间预期文档明确说明脚本耗时取决于 CPU 核心数约10–30 分钟flash-attn是从源码构建的中间长时间没有新输出属正常不要误判为卡死。两条路径有一个差异值得知道走cu130时系统里常有的 CUDA 12.x toolkit 太旧脚本会额外通过 pip 安装一组版本锁定在13.0,13.1的 CUDA 13.0 编译工具链nvidia-cuda-nvcc、nvidia-cuda-crt、nvidia-nvvm、nvidia-cuda-cccl、nvidia-cuda-runtime把CUDA_HOME指向 pip 包内的cu13目录来构建flash-attn并对TORCH_CUDA_ARCH_LIST使用默认值8.0;8.6;8.9;9.0;10.0环境变量已设置时沿用你的值。cu129路径不需要这一步。如何判断装成功、失败时看哪里脚本开头会打印三行确认信息先核对它们与你的意图一致Using Python executable: .venv/bin/python Using VERL version: 0.8.0 Using CUDA wheel variant: cu130判断依据参数不合法版本号或变体写错时脚本打印Usage: bash scripts/setup_verl.sh 0.7.1|0.8.0 cu129|cu130 [venv_path]并立即退出不会开始安装脚本以set -euo pipefail运行任何一条安装命令失败都会使整个脚本终止。最终能正常跑完10–30 分钟内自然结束、退出码为 0即表示这套锁定的 GPU 栈装好了如果报expected Python executable not found说明.venv缺失或位置不对——先回项目根目录执行uv sync或在第三个参数传入正确的 venv 路径。安装指南本身没有给出额外的独立校验命令GPU 栈是否可用按 Quick Start 的说明下一步就是用它启动一次真实训练任务需要一台带一张 A100 GPU 的机器该示例会启动 Ray、verl/vLLM 模型后端、agl-server与本地 controller。下一步安装指南的 Step 3 是 WB 登录因为默认所有任务都会把日志和轨迹上传到 Weights Biasesuv run wandb login之后即可按 Quick Start 跑通第一个本地训练任务验证刚装好的verlGPU 栈端到端可用。【免费下载链接】agent-lightningThe absolute trainer to light up AI agents.项目地址: https://gitcode.com/GitHub_Trending/ag/agent-lightning创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表