ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

借助AI工具学习:控制科学研究方向——目标识别与环境理解

借助AI工具学习:控制科学研究方向——目标识别与环境理解 目标识别与环境理解两周试错学习清单目标不碰昂贵硬件用电脑开源代码快速体验控制学科视角的环境感知判断自己是否适合这个方向。 前提环境Python3.10PyTorchCUDA没有显卡也可以用Colab云端运行。 总周期14天每天2‑3小时即可优先跑通代码不要死磕理论。前置准备第0天1小时软件安装安装Anaconda创建环境conda create -n perception python3.10 conda activate perception pip install ultralytics opencv-python torch torchvision matplotlib pcl-python数据集下载COCO小样本YOLOv8自带不用手动下KITTI三维感知KITTI官网只下载object数据集不用全部下完仿真工具GazeboROS2 HumbleWindows建议用WSL2不想装ROS就先用Colab做算法仿真放后面必看入门资料快速建立认知课程深蓝学院《机器视觉基础》前3讲免费B站片段搞懂相机成像、针孔相机模型、内外参。文章《机器人环境感知从图像到三维世界》CSDN了解控制学科和纯CV的区别阅读YOLOv8官方文档看懂检测、分割、跟踪三个任务。第1‑3天基础任务2D目标检测多目标跟踪任务目标跑通目标检测理解“识别物体跟踪物体”这是目标识别最基础模块。Day1跑通YOLOv8检测from ultralytics import YOLO model YOLO(yolov8n.pt) results model.predict(test.mp4, saveTrue)输出视频里框出行人、车辆、障碍物。思考问题遮挡、暗光下识别失效是什么现象为什么会失效Day2多目标跟踪ByteTrackmodel.track(sourcetest.mp4, persistTrue)得到每个目标ID、轨迹观察目标被遮挡后ID跳变的问题。作业自己找一段户外监控视频跑一遍记录哪些情况识别失败。Day3语义分割model YOLO(yolov8n-seg.pt) model.predict(sourcetest.mp4, saveTrue)区分道路、人、车、建筑理解语义分割不仅知道是什么还知道像素属于哪一类这是环境理解的基础。阅读材料书《OpenCV实战》只看图像处理章节论文快速浏览YOLOv8原文摘要不用啃全部公式。✅ 验收标准你可以自己输入任意视频输出带检测/分割结果的视频能说出3个算法缺陷。第4‑6天三维感知入门环境理解核心重点控制方向的环境理解不只是2D图片需要空间位置、距离、三维结构。Day4相机几何基础搞懂概念针孔相机、内参、外参、旋转矩阵、四元数用OpenCV做简单的相机标定示例代码看懂标定输出的矩阵含义。不用自己动手标定真实相机看懂代码逻辑即可。Day5单目深度估计 使用Depth‑Anything开源项目输入一张图片输出深度图。理解从2D图像估算物体距离明白单目深度有尺度漂移这是机器人感知的痛点。Day6点云基础PCL学习点云是什么简单运行PCL示例点云可视化、滤波。浏览KITTI数据集看激光雷达点云样本理解激光雷达输出三维空间坐标。阅读《视觉SLAM十四讲》第1‑3章只看几何部分不要啃完整本书。 不要硬啃全部数学先建立感性认识。✅验收标准能看懂一张深度图、一张点云图知道“2D图像”和“三维环境”的差别。第7‑8天多传感器融合 状态估计控制学科特色纯计算机视觉很少做这块这是控制专业做环境感知最大的差异化。Day7卡尔曼滤波基础看懂EKF/卡尔曼滤波的作用对传感器噪声做滤波预测目标运动状态位置、速度运行简单Python实现的卡尔曼滤波示例模拟跟踪一个运动物体。结合前面YOLO跟踪检测结果有噪声卡尔曼滤波用来平滑目标轨迹。Day8简单理解多传感器融合思考问题相机看得到类别但没有距离激光雷达有距离但不知道物体是什么如何把两者结合阅读开源项目Lidar‑Camera‑Fusion看示例代码逻辑不必完整复现。✅验收标准能讲清楚为什么机器人不能只用相机必须融合多传感器。第9‑11天仿真环境感知‑规划闭环控制学科的灵魂核心感知出来的结果要给机器人做导航避障这才是控制的环境理解不是单纯做图像算法。 如果你电脑装不了ROS2直接用Colab跑算法仿真可以延后重点理解逻辑。Day9ROS2基础概念 搞懂话题、消息、节点理解相机节点输出图像感知节点处理图像输出障碍物信息给导航节点。Day10Gazebo仿真 搭建虚拟室内/室外环境虚拟机器人搭载相机目标仿真机器人摄像头识别障碍物输出障碍物位置。Day11简单避障逻辑感知识别到障碍物距离小于阈值机器人停止/转向。这就是完整小闭环感知→决策→控制。资料B站 ROS2 Humble入门教程优先看机器人感知相关。✅验收标准理解“算法跑在电脑上只是第一步最终要给机器人执行动作”。第12‑13天高阶开源项目浏览了解硕士课题长什么样不用完整复现看懂任务、数据集、评价指标感受真实科研课题。项目1语义SLAMORB‑SLAM3 语义分割任务一边建地图一边标记地图上物体类别实现语义导航。项目2开放词汇目标检测 SAMYOLO任务识别训练集没有见过的物体应对开放真实环境。项目3KITTI三维目标检测用点云做三维检测看评价指标mAP。阅读几篇硕士毕业论文摘要哈工大、北理工自动化学院看他们的课题是怎么做的。第14天复盘评估判断自己适不适合该方向问自己5个问题诚实回答我是否愿意花大量时间调代码、调参数、处理脏数据集面对三维几何、矩阵变换我能沉下心啃数学吗我喜欢“算法硬件仿真闭环”还是更喜欢纯理论推导我能接受很多实验结果不理想反复改代码不一定能出漂亮结果对比如果让我做嵌入式、PLC、控制算法哪个我更愿意长期做如果大部分答案是“是”这个方向适合你如果很痛苦那可以考虑控制下面其他方向比如嵌入式、运动控制、故障诊断。推荐书单优先选不要全读《视觉SLAM十四讲》控制方向必看重点前6章几何后面可以先放一放。《机器视觉》冈萨雷斯图像处理基础。《概率机器人》机器人状态估计、滤波、SLAM的经典。开源项目收藏后续深入YOLOv8Ultralytics目标检测分割Depth‑Anything单目深度估计ORB‑SLAM3视觉SLAMPointNet点云深度学习ROS2‑Humble机器人仿真平台数据集COCO2D检测分割KITTI自动驾驶三维感知NuScenes多传感器数据集TUM‑RGB‑D视觉SLAM数据集针对你的提醒不要一开始就冲深度学习论文先跑通代码建立感性认知再回头补理论这个方向工程工作量巨大不是靠做题你本科机械控制背景你的优势是懂机器人运动、控制闭环短板是深度学习、C、ROS考研选导师的时候重点看导师课题是否面向机器人/无人系统感知而不是纯计算机视觉。问题1报错原因ModuleNotFoundError: No module named torch✅ 不是代码写错了VS Code现在用的是系统Python3.13不是我们刚刚装好的perception虚拟环境。 torch、ultralytics这些包全都安装在perception这个独立环境里面系统Python根本没有装这些库所以找不到torch。两种解决办法方法1在VS Code切换解释器推荐以后写代码都用这个按快捷键CtrlShiftP弹出命令面板输入Python: Select Interpreter在列表里找到perception这个环境Python3.10选中它重新运行代码就可以正常import torch了如果列表里看不到perception重启VS Code再重新选解释器。方法2先用Anaconda Prompt验证最简单先确认环境没问题打开Anaconda Prompt (Miniconda3)conda activate perception python然后粘贴这三行代码测试import torch print(torch.cuda.is_available()) print(torch.cuda.get_device_name(0))这里能跑成功就代表环境本身没问题只是VS Code没选对Python解释器。重点提醒虚拟环境是隔离的 包装在哪个环境就必须选用对应环境的Python解释器来运行代码。 你现在VS Code右下角可以看到Python 3.13.0这是系统Python不是perception。后续等你在VS Code成功切换到perceptionPython3.10之后就可以直接在VSCode写YOLO、Open3D的代码不用每次切Anaconda终端。需要我帮你把YOLO测试代码准备好等解释器切换完成直接运行吗 RichMediaCreation{type:SoftLink,detail:切换到工作任务模式}/RichMediaCreation
返回列表