?)
如何关闭 TRL 的匿名使用统计收集遥测【免费下载链接】trlTrain transformer language models with reinforcement learning.项目地址: https://gitcode.com/GitHub_Trending/tr/trl如果你在用 TRL 做强化学习训练又希望训练脚本不向外部发送任何使用统计常见于内网环境或对数据外发敏感的团队官方文档给出了明确的关闭方式设置两个环境变量之一即可。TRL 会发送哪些统计TRL 会在每次实例化 trainer 时发送一次匿名统计使用统计文档。上报的字段包括TRL 版本号如1.5.0trainer 类名仅当它是 TRL 自带的 trainer如SFTTrainer、GRPOTrainer时才会上报用户自定义子类一律记为other模型架构仅当它是transformers已知的模型类型时才会上报如llama、qwen3自定义或私有架构记为other是否在使用 PEFT训练数据的加载方式hub从 Hub 下载、files通过json/csv等文件方式读取、memory进程内构建如Dataset.from_dict或other。数据集名称和路径不会被收集分布式后端deepspeed、fsdp、ddp或none进程规模分档上报1、2-8、9-64、65加速器类型cuda、xpu、npu、mlu、mps、cpuGPU 型号如NVIDIA H100 80GB HBM3可得时上报。文档同时声明不收集数据集名称、文件路径、模型标识符、超参数值或其他任何用户提供的数据。需要留意的一点是和任何 HTTP 请求一样发起端的源 IP 与标准 HTTP 头对服务器可见。发送逻辑本身在 base_trainer.py 的_send_telemetry中实现只在主进程rank 0发送跳过 CI 运行并通过 huggingface_hub 的send_telemetry发送。关闭遥测设置环境变量官方文档给出的关闭方式是在训练环境的 shell 会话中设置以下两个环境变量之一export HF_HUB_DISABLE_TELEMETRY1 # disables telemetry for all HF libraries export HF_HUB_OFFLINE1 # disables all network calls to the Hub两者的作用范围不同按需选择HF_HUB_DISABLE_TELEMETRY1仅关闭遥测覆盖所有 HF 库训练仍然可以联网访问 Hub。HF_HUB_OFFLINE1禁用对 Hub 的一切网络调用范围更大。如果训练需要在线拉取模型或数据集它会直接影响可用性只适用于完全离线的训练场景。export只对当前 shell 会话及其子进程生效所以必须在启动训练脚本的那个 shell 里设置如果训练通过accelerate launch等命令拉起环境变量会随进程继承无需额外传递。如何确认遥测已关闭发送侧的判断逻辑可以对照 base_trainer.py 阅读非主进程accelerator.is_main_process为False不发送CI环境变量已设置时不发送——CI 环境无需额外配置HF_HUB_DISABLE_TELEMETRY1或HF_HUB_OFFLINE1由send_telemetry内部处理设置后不再发送。也就是说除了 CI 场景外判断是否已关闭的依据就是确认启动训练脚本的进程环境中存在这两个变量之一可用env | grep HF_HUB查看当前 shell。文档没有提供额外的验证命令或可观察的成功输出send_telemetry静默发送关闭与否不会改变训练的可见日志。作用范围与边界两个变量都是 Hub 层面的开关作用于所有 HF 库不只是 TRL 自身的遥测。HF_HUB_OFFLINE1同时会切断训练对 Hub 的下载能力在线拉取模型/数据集的训练流程不适用。文档没有提供任何 trainer 级别的关闭参数如果某个进程没有设置上述环境变量且不在 CI/离线模式下实例化 trainer 时就会发送一次统计。文档也说明保持遥测开启是维护者了解各 trainer 与硬件配置使用情况的方式之一——如果环境允许外发请求是否关闭由你自己权衡。【免费下载链接】trlTrain transformer language models with reinforcement learning.项目地址: https://gitcode.com/GitHub_Trending/tr/trl创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考