
1. 引言期刊简称IEEE ITS Magazine导读世界模型能解决深度强化学习交通控制训练数据难获取的问题吗城市路口信号灯配时不合理早晚高峰堵车让人心累。这项研究把「世界模型」引入深度强化学习交通信号控制用数据驱动的方式直接生成训练数据绕开耗时且难标定的微观交通仿真。仿真/实验显示加入世界模型后多路口网络场景下各算法的平均排队长度、平均旅行时间和平均等待时间均显著下降训练收敛也更快。2. 基本信息项目内容论文原题名Boosting the Training of Deep Reinforcement Learning Traffic Control by Using the World Model中文译题利用世界模型提升深度强化学习交通控制的训练效果刊载期刊IEEE Intelligent Transportation Systems MagazineIEEE ITS Magazine全部作者Pengbo Wang、Yisheng Lv、Jingwei Ge、Li Li作者所属单位清华大学自动化系中国科学院自动化研究所多模态人工智能系统国家重点实验室清华大学北京信息科学与技术国家研究中心论文关键词深度强化学习交通信号控制世界模型数据效率交通流预测SUMO仿真发表时间2024年8月20日在线发表2025年5/6月刊卷号17文章号58–66DOI10.1109/MITS.2024.34400693. 研究动机与背景缓解深度强化学习训练数据难以获取的痛点。传统DRL需要大量交互数据才能学到最优策略而在真实交通场景中长时间观测记录车流、车辆行为等信息成本高、难度大数据效率成为制约瓶颈。让仿真数据生成更高效、更易标定。许多DRL交通控制方法依赖微观交通仿真生成训练数据但微观仿真既耗时又难以根据实地数据标定生成的仿真结果可能有偏难以支撑训练出好的DRL模型。同时考虑真实数据与仿真数据的融合利用。本文希望既能利用有限的实地数据又能借助仿真平台补充样本让世界模型在两类数据上学习交通流动态与信号控制的影响从而提升训练效率与控制效果。4. 核心创新点用世界模型替代微观交通仿真生成训练数据。通过数据驱动的方式直接生成车流、车辆行为等充足数据无需繁琐的微观仿真参数标定。联合建模交通流动态与信号控制影响。世界模型不仅学习交通流本身的演化还学习信号控制策略对交通模式的影响从而更准确地模拟环境反馈。方法层面的巧思环境—记忆—控制三部分结构。借鉴人脑的感知、记忆与决策机制将世界模型拆分为环境部分、记忆部分和控制部分分别负责感知、记录与决策。评估维度上的新意多算法、多场景对比。在单路口与多路口网络两类数据集上对DQN、PPO、SAC、CoLight、MASAC等多种算法逐一验证世界模型的增益并给出训练曲线与收敛速度分析。5. 论文摘要深度强化学习DRL交通控制因被视为缓解拥堵的有力工具而日益受到关注但传统DRL模型需要大量交互数据这些数据在实地测试和仿真测试中都难以收集。为克服这些挑战本文采用世界模型来更好地训练用于交通控制的DRL模型。所提出的世界模型能够基于有限的实地与仿真数据快速学习交通流动态以及信号控制的影响随后DRL控制模型可以转而基于世界模型生成的训练数据来建立。实验结果表明使用世界模型的DRL交通控制能够取得明显更优的信号控制策略为优化城市交通提供了一种有前景的解决方案。关键数字在多路口网络数据集上CoLightWM相较CoLight平均排队长度从16.7降至15.2降低约9%平均旅行时间从294.1秒降至269.8秒降低约8.3%平均等待时间从134.6降至120.4降低约10.5%MASACWM相较MASAC平均排队长度从14.7降至12.1降低约17.7%平均旅行时间从240.4秒降至193.4秒降低约19.6%平均等待时间从119.5降至81.3降低约32%。6. 研究方法6.1 方法总起世界模型驱动的交通信号控制框架本文构建了一个模仿人脑连贯思考与决策过程的世界模型整体分为环境部分、记忆部分与控制部分。环境部分作为感官输入感知复杂动态环境记忆部分记录并管理过去、现在与预测的世界状态及其代价或奖励控制部分负责与环境交互利用整合的数据、记忆与预测信息做出决策。研究对象为城市路网中的信号灯控制边界设定在单路口与多路口网络两类场景。真实环境数据世界模型LSTMSUMO微观仿真数据生成训练数据DRL控制模型信号控制动作SUMO环境反馈6.2 环境部分SUMO仿真平台环境部分指模拟交通网络与信号控制的虚拟环境。本文利用开源微观仿真平台SUMO构建模拟真实交通信号控制环境的平台能够精确建模交通网络、定义路网拓扑、指定不同路口的交通需求并模拟车辆行为与路口交通交互评估信号控制策略对交通模式的影响为评估各类交通管理方案提供平台。6.3 记忆部分LSTM预测网络记忆部分的核心是一个基于LSTM的预测网络它利用带时间信息的神经网络持续获取数据。该网络接收过去N个时刻的观测序列通过LSTM单元提取时序特征输出对下一时刻状态的预测。预测网络不断将新生成的数据与原始数据集整合作为DRL算法的输入从而加速样本获取并提升样本利用率。6.4 控制部分DRL算法训练控制部分直接负责与环境交互。本文在单路口数据集上对比DQN、PPO、SAC三种算法在多路口网络数据集上对比CoLight、MASAC两种算法分别考察加入世界模型WM前后的控制效果。训练过程中世界模型与DRL控制模型都持续由SUMO生成的新数据更新。6.5 实验/仿真设置实验使用两类数据集单路口交通流数据集与多路口网络交通流数据集。评估指标包括平均排队长度ANQ、平均旅行时间ATT与平均等待时间AWT。对比基线为不使用世界模型的各DRL算法。训练过程中记录奖励随回合数的变化曲线用于分析收敛速度。7. 实验结果7.1 发现1单路口场景增益有限在单路口数据集上加入世界模型后各DRL算法的ANQ与AWT并未出现显著改善。原因在于单路口场景下DRL算法本身已能有效控制信号灯额外增加的样本数据对控制效果的提升并不明显。DQNWM的ANQ从13.2降至12.8SACWM从12.8降至12.7改善幅度都很小。算法ANQ (veh)AWT (s/veh)DQN13.24.6*DQN WM12.8*4.6*PPO18.47.2PPO WM17.9*7*SAC12.84.9SAC WM12.7*4.7*表注最优值以粗体加星号标记veh表示车辆数WM表示使用世界模型。单路口场景下世界模型带来的增益有限。7.2 发现2多路口网络场景显著改善在多路口网络数据集上加入世界模型后各算法的ANQ、ATT与AWT均显著下降。随着路口数量增加DRL算法需要大量样本数据训练而样本获取速度却在下降世界模型恰好弥补了这一短板。MASACWM的AWT从119.5降至81.3降幅约32%改善最为明显。需要诚实说明并非每项指标在所有算法上都达到最优但整体趋势一致向好。算法ANQ (veh)ATT (s)AWT (s/veh)CoLight16.7294.1134.6CoLight WM15.2*269.8*120.4*MASAC14.7240.4119.5MASAC WM12.1*193.4*81.3*表注最优值以粗体加星号标记veh表示车辆数WM表示使用世界模型。多路口网络场景下世界模型带来显著改善。7.3 发现3训练收敛速度加快从训练曲线图4可以看出加入世界模型后不同RL算法获得了更多路况信息预测数据奖励随回合数的收敛速度明显快于仅使用DRL算法。世界模型帮助DRL获得更多数据、更好地控制信号灯并更快取得更好的控制结果。这是因为模型能更好地提取交通特征信息学习更优的价值与策略函数从而显著加速样本获取并提升样本利用率。7.4 发现4作者也考虑的代价与成本作者在文中也坦诚讨论了世界模型的代价维度世界模型本身需要训练其建模精度直接影响生成数据的质量当前实现采用简单的LSTM模型虽然已足够提升控制性能与样本利用效率但仍有进一步提升建模精度的空间。此外世界模型利用历史序列观测信息预测智能体当前状态并结合非相邻智能体之间的信息以提升交通流更复杂时模型训练的鲁棒性。8. 结语研究解决的问题与意义本文提出基于世界模型的交通信号控制方法有效加速了控制部分样本数据的获取并提升了样本利用率从而加快模型训练并增强控制效果。研究边界在于当前世界模型采用简单的LSTM实现建模精度仍有提升空间。研究局限与未来方向证据来源为SUMO仿真实验未覆盖真实路测场景作者指出未来将分析如何提升世界模型的建模精度并探索利用世界模型增强交通数据生成、向控制模块输送多样且精细的数据最终改善控制效果。总体而言本文为世界模型在交通控制中的应用提供了有价值的探索但结论不宜过度夸大。—— 点赞 / 分享 / 在看 ——欢迎关注本公众号持续获取智能交通与AI前沿论文导读。想加入读者交流群、与作者和同行深入讨论欢迎在后台留言「加群」。往期推荐深度强化学习在单路口信号控制中的模型对比多智能体强化学习如何协调城市路网信号灯基于注意力机制的动脉路信号控制新方法交通流预测与信号控制的联合优化思路从DQN到MASAC交通信号控制的强化学习演进