ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

DI-drive核心概念10分钟读懂:Policy与Env二分设计及collect/eval/learn三模式

DI-drive核心概念10分钟读懂:Policy与Env二分设计及collect/eval/learn三模式 DI-drive核心概念10分钟读懂Policy与Env二分设计及collect/eval/learn三模式【免费下载链接】DI-driveDecision Intelligence Platform for Autonomous Driving simulation.项目地址: https://gitcode.com/gh_mirrors/di/DI-driveDI-drive是一个开源的自动驾驶决策智能平台Decision Intelligence Platform for Autonomous Driving simulation它把复杂的自动驾驶仿真框架拆解为Policy策略与Env环境两大部分并让策略以collect / eval / learn 三种模式运行。看懂这套核心设计你就能快速上手用 DI-drive 跑通模仿学习、强化学习、GAIL 等各类自动驾驶实验。上图是 DI-drive 的核心架构图也是最值得先记住的一张图Policy 与 Env 之间只流转两样东西——Observation观测和Action动作信息在此循环往复模型得以被更新、环境得以被可视化、策略得以被评估。一、二分设计Policy 负责开车Env 负责造世界DI-drive 的设计哲学非常简单把决策和仿真彻底分开两者各自独立演化又通过标准接口协作。1. Policy把观测映射为动作的司机输入当前观测相机图像、鸟瞰图、车速等输出车辆动作转向、油门、刹车Policy 可以是感知、决策、规划、控制环节中的任意一环既可以是神经网络也可以是传统控制器如 PID所有策略统一实现init、reset、forward等接口基类定义在 core/policy/base_carla_policy.py2. Env返回新观测的虚拟世界Env 遵循强化学习gym 风格的标准定义核心接口为reset/step/close/seed基类在 core/envs/base_drive_env.py。它内部包含三类组件组件职责simulator 仿真器与 Carla / MetaDrive 等仿真引擎交互推进世界planner 规划器为车辆提供导航路线处理选道与避撞visualizer 可视化器渲染画面、实时显示速度/指令等运行参数这种观测 → 动作的最小闭环就是所有自动驾驶智能方法能跑在 DI-drive 上的引擎。二、三模式设计collect、eval、learn 各管一段同一个 Policy在不同场景下行为应当不同——采样数据时要用专家逻辑评估时看性能训练时算损失。DI-drive 借鉴 DI-engine 的策略定义给策略内置了三种运行模式共享同一套核心网络但接口行为可以不同对应图中learn_mode、collect_mode、eval_modecollect采集模式负责与collector协作让策略在环境中采样数据eval评估模式负责与evaluator协作在基准测试套件上闭环验证策略表现learn学习模式负责与learner协作用数据更新模型参数三者各自有抽象基类结构统一reset/ 主方法 /close采集器core/data/base_collector.py评估器core/eval/base_evaluator.py 模式映射非常直观调用policy.collect_mode.forward就等价于调用policy._forward_collect用户只需面向统一接口编程无需关心内部实现。三、三模式如何支撑不同算法模仿学习与强化学习理解了二分 三模式各类算法在 DI-drive 中的落地路径就一目了然模仿学习IL三步走collect策略跑在环境里采样专家驾驶数据存入dataset 数据集learn用数据集训练神经网络模仿专家输出eval训练好的模型在环境中闭环评测输出成绩表强化学习RL则把存数据集换成存replay buffer 经验回放池然后即时或延迟地更新策略。对应到示例代码模仿学习全流程采集 → 训练 → 评估demo/cilrs/强化学习多算法训练/评估demo/simple_rl/概念文档原文docs/source/tutorial/core_concepts.rst四、10 分钟上手先跑起来再看细节最快速度感受 DI-drive 的方式是运行内置的自动策略看可视化效果需先启动 Carla 服务器并配置 host/portcd demo/auto_run python auto_run.py上图就是策略在 Carla 城镇中行驶时的可视化界面左上为前视语义分割左下为前视 RGB 图像右下为鸟瞰图右侧实时显示速度、转向、油门、刹车、剩余距离与导航指令FOLLOW/LEFT 等。五、小结二分设计Policy 管决策Env 管仿真中间只传 Observation 与 Action三模式collect 采数据、eval 评性能、learn 训模型同一策略多态复用可扩展Policy 可替换为自动驾驶管线的任意环节算法、仿真器、数据集自由组合掌握这两条主线你就已经读懂了 DI-drive 的全部骨架——接下来只需按需查阅各 demo 与文档即可把自己的算法跑进这套统一的自动驾驶仿真平台中。【免费下载链接】DI-driveDecision Intelligence Platform for Autonomous Driving simulation.项目地址: https://gitcode.com/gh_mirrors/di/DI-drive创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表