
HY-World 2.0 架构全景解析4阶段流水线如何把一句话变成可探索3D世界【免费下载链接】HY-World-2.0HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds项目地址: https://gitcode.com/gh_mirrors/hy/HY-World-2.0HY-World 2.0是腾讯开源的多模态世界模型框架核心能力是把一句话、一张图片或一段视频变成可自由探索、可编辑的真实3D 世界高斯泼溅 3DGS / 网格 Mesh。与看一段就消失的视频世界模型不同HY-World 2.0 直接产出持久化的 3D 资产可直接导入 Blender / Unity / Unreal / Isaac。下面用新手友好的方式拆解它的4 阶段流水线全景图生成HY-Pano 2.0→ 轨迹规划WorldNav→ 世界扩展WorldStereo 2.0→ 世界组合WorldMirror 2.0 3DGS 训练并讲清另一条重建路线。️ HY-World 2.0 是做什么的3D 世界模型 vs 视频世界模型视频世界模型如 Genie 3、Cosmos生成的是像素视频——像看电影播放完就没了。HY-World 2.0 走的是另一条路直接产出真实可编辑的 3D 资产更像造一个能玩的游戏。对比维度视频世界模型HY-World 2.03D 世界模型输出像素视频不可编辑网格 / 3DGS完全可编辑可玩时长有限通常 1 分钟无限——资产永久保留3D 一致性无跨视角闪烁原生——3D 天然一致实时渲染需逐帧推理、延迟高消费级显卡即可实时渲染引擎兼容✗ 仅视频文件✓ 直接导入 Blender / UE / Isaac它提供两大核心能力世界生成World Generation文本 / 单图 → 可导航 3D 世界走 4 阶段流水线世界重建World Reconstruction多视角图像 / 视频 → 3D由 WorldMirror 2.0 一次前向完成 架构总览4 阶段流水线一图看懂先看全局。HY-World 2.0 的文本 → 3D 世界由 4 个阶段串联完成每个阶段由一个独立模型负责逐级加工阶段负责模型作用对应代码Stage 1 全景图生成HY-Pano 2.0~80B文本 / 单图 → 360° 全景hyworld2/panogen/Stage 2 轨迹规划WorldNav解析场景 规划相机路径traj_generate.pyStage 3 世界扩展WorldStereo 2.0~17B沿轨迹生成关键帧、补全世界video_gen.pyStage 4 世界组合WorldMirror 2.0~1.2B 3DGS重建几何 训练高斯泼溅world_gs_trainer.py各阶段通过共享的场景目录--target_path累积中间结果全景图 → 轨迹 → 关键帧视频 →gs_data/→ 3DGS 输出像工厂流水线一样一级传一级。 Stage 1HY-Pano 2.0 全景图生成——先造一张 360° 底图流水线的起点是把一句话或一张普通照片变成一张360° 等距圆柱ERP全景图。它是整个 3D 世界的底图——后续所有阶段都围绕它展开。HY-Pano 2.0 提供两个后端HunyuanImage-3 后端pipeline.py完整推理流水线内部先think思考→ recaption改写提示词→ diffuse扩散生成语义更连贯、质量更高。Qwen-Image-Edit 后端pipeline_with_qwen_image.py基于 diffusers LoRA 的轻量方案加载更快、更易集成。两个后端暴露同一个HunyuanPanoPipeline接口默认输出1920×960的 ERP 全景并用圆形边缘融合让左右首尾无缝衔接。仓库内置的全景图示例长这样 Stage 2WorldNav 轨迹规划——VLM 带着相机去探险有了全景底图下一步是规划相机该怎么走。WorldNav 由 traj_generate.py 和 src/navi_utils.py 实现核心思路是让 VLM 当导航员VLMQwen3-VL识别有趣目标先找出场景里值得看的物体写入objects.json。规划多样轨迹环绕surround、探索exploration、重建reconstruction、航拍aerial四类路径。避障导航基于 NavMeshthird_party/navmesh recastnavigation做障碍感知寻路并迭代精化。SAM3 语义分割引导导航避开地面与障碍。规划完成后traj_render.py 在多卡上沿这些轨迹做点云渲染并让 VLM 给每条轨迹打字幕为下一阶段提供条件输入。 Stage 3WorldStereo 2.0 世界扩展——沿轨迹长出更多世界WorldStereo 2.0代码在 hyworld2/worldgen/models/是一个基于扩散的生成模型负责沿规划好的相机轨迹把场景扩展出去生成逼真关键帧。它有三个关键机制WorldStereoModel扩展自 WanTransformer3DModel 的 Transformer 骨干带相机嵌入和基于点云渲染的ControlNet 条件。PanoramaMemoryBanksrc/retrieval_wm.py检索式记忆库通过参考全景注入维持跨轨迹一致性——换到另一个角度看到的还是同一个世界。DMD分布匹配蒸馏4 步推理模式大幅加速生成默认worldstereo-memory-dmd。 Stage 4WorldMirror 2.0 3DGS 世界组合——收敛成可渲染的 3D 世界最后一步是把生成的关键帧视频收敛成一个几何一致、可实时渲染的 3D 世界数据准备gen_gs_data.py抽帧、对齐深度图与法线、整理相机参数打包成 3DGS 训练数据gs_data/。3DGS 训练world_gs_trainer.py用定制的 gsplat_maskgaussian 做可微光栅化 自适应概率性高斯剪枝配合深度 / 法线 / LPIPS 正则提升几何质量并支持天空感知训练。导出输出.ply、.spz压缩和网格 MeshTSDF 融合可直接进引擎。 另一条路线WorldMirror 2.0 世界重建——拍张照片直接建数字孪生除了生成HY-World 2.0 还提供重建能力多视角图像或随手拍的视频 → 3D由WorldMirror 2.0hyworld2/worldrecon/pipeline.py一个前向网络同时预测出世界坐标下的3D 点云每个视角的深度图表面法线相机位姿与内参3DGS 属性中心、尺度、旋转、透明度、球谐系数约1.2B参数的统一前馈模型支持灵活分辨率50K–500K 像素推理多卡时用Sequence Parallel FSDP BF16加速并提供 Gradio 网页交互演示在浏览器里就能看 3DGS、点云、深度、法线和相机参数。 新手上手最快跑通 3D 世界重建推荐环境CUDA 12.8 Python 3.11多卡建议 ≥4 卡8×H20 实测。完整命令与参数见 hyworld2/worldgen/README.md 和 DOCUMENTATION.md。git clone https://gitcode.com/gh_mirrors/hy/HY-World-2.0 cd HY-World-2.0 conda create -n hyworld2 python3.11.15 conda activate hyworld2 pip install -r requirements.txt # 自定义 gsplatworldrecon 与 worldgen 共用 cd hyworld2/worldgen/third_party/gsplat_maskgaussian pip install -e . --no-build-isolation世界重建是新手最友好的切入点单卡即可跑python -m hyworld2.worldrecon.pipeline --input_path path/to/images4 阶段世界生成流水线多卡需先起一个 vLLM 服务承载 Qwen3-VL-8B 供 WorldNav 调用TARGET_PATH/path/to/scene # 场景目录内含 panorama.png # Stage 1 全景图生成HY-Pano 2.0 python hyworld2/panogen/pipeline.py --image input.png --save $TARGET_PATH/panorama.png # Stage 2 轨迹规划 渲染WorldNav python hyworld2/worldgen/traj_generate.py --target_path $TARGET_PATH --llm_addr 0.0.0.0 --llm_port 8000 # Stage 3 世界扩展WorldStereo 2.0 torchrun --nproc_per_node 8 hyworld2/worldgen/video_gen.py --target_path $TARGET_PATH --fsdp # Stage 4 世界组合3DGS 数据 训练 导出网格 torchrun --nproc_per_node 8 hyworld2/worldgen/gen_gs_data.py --root_path $TARGET_PATH --save_normal --split_sky python -m hyworld2/worldgen/world_gs_trainer default --data_dir $TARGET_PATH/gs_data --export_mesh 多卡模式下输入图像数量必须≥ GPU 数量如 8 卡至少给 8 张图完整参数与输出格式详见 DOCUMENTATION.md。✨ 小结一句话读懂 HY-World 2.0 架构HY-World 2.0 用一条清晰可拆的4 阶段流水线把文本 → 3D 世界这件难事拆成 4 个各司其职的模型HY-Pano 2.0负责画底图360° 全景WorldNav负责定路线相机轨迹WorldStereo 2.0负责长世界沿轨迹生成关键帧WorldMirror 2.0 3DGS负责成资产几何一致的高斯泼溅世界再叠加一条 WorldMirror 2.0 的世界重建路线拍张照片就能建出数字孪生。对新手来说最省心的路径是先跑通单卡的世界重建WorldMirror 2.0 / Gradio再逐步扩展到完整 4 阶段生成——这也是官方推荐的安装顺序。【免费下载链接】HY-World-2.0HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds项目地址: https://gitcode.com/gh_mirrors/hy/HY-World-2.0创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考