HY-World 2.0 快速开始完整指南:10分钟搭建环境,从文字/图片到可探索3D世界
【免费下载链接】HY-World-2.0HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds项目地址: https://gitcode.com/gh_mirrors/hy/HY-World-2.0
HY-World 2.0是一个开源的多模态 3D 世界模型(World Model)框架:输入一句文字或一张图片,就能生成可自由漫游的真实 3D 世界(3DGS / 网格);输入多视角图片或一段视频,即可瞬间完成 3D 重建。本指南带你 10 分钟完成环境搭建,跑通第一次 3D 世界重建,并了解「文字/图片 → 可探索 3D 世界」的完整生成流程。
一、2分钟认识 HY-World 2.0:输出"真 3D 资产"的世界模型
HY-World 2.0 提供两大核心能力:
| 能力 | 输入 | 输出 |
|---|---|---|
| 🌍世界生成(World Generation) | 文字 / 单张图片 | 360° 全景 → 可导航 3D 世界(3DGS / 网格) |
| 📷世界重建(World Reconstruction) | 多视角图片 / 视频 | 深度图、法线、点云、相机参数、3DGS |
与"生成像素视频"的世界模型不同,HY-World 2.0 产出的是可编辑、可持久化的真实 3D 资产:消费级 GPU 即可实时渲染漫游,并能直接导入 Blender / Unity / Unreal Engine。下图展示了这套 3D 世界模型的生成与重建效果:
整个系统是一条流水线:全景生成(HY-Pano 2.0)→ 轨迹规划(WorldNav)→ 世界扩展(WorldStereo 2.0)→ 世界组合(WorldMirror 2.0 + 3DGS 学习),最终把文字或单张图像自动转化为高保真、可漫游的 3D 世界。
二、10分钟环境搭建:CUDA 12.8 + Python 3.11 安装步骤
环境要求一览
| 项目 | 建议配置 |
|---|---|
| GPU | NVIDIA 显卡(CUDA 12.8);重建单卡可跑,生成推荐 ≥4 卡 |
| 系统 | Linux(推荐) |
| Python | 3.11+(conda 环境python=3.11.15) |
| 磁盘 | 模型权重首次运行自动下载(WorldStereo 2.0 约 17B 参数),建议预留充足空间 |
💡 无需手动下载任何模型权重,首次运行会自动拉取,这也是"10 分钟起步"的关键。
步骤 1:克隆仓库并创建 conda 环境
git clone https://gitcode.com/gh_mirrors/hy/HY-World-2.0 cd HY-World-2.0 conda create -n hyworld2 python=3.11.15 conda activate hyworld2步骤 2:安装 worldrecon 基础依赖(WorldMirror 2.0)
这一步完成后,环境即可运行世界重建模块:
# 基础依赖(worldrecon 与 worldgen 共用) pip install -r requirements.txt # 推荐:安装一次自定义 gsplat 渲染后端,重建与生成共用 cd hyworld2/worldgen/third_party/gsplat_maskgaussian pip install -e . --no-build-isolation cd ../../../../步骤 3:安装 FlashAttention(二选一后端之一即可)
# 简单方案:FlashAttention-2 pip install flash-attn --no-build-isolation如果你用的是 Hopper 架构 GPU(如 H100/H20),推荐从源码编译安装 FlashAttention-3,具体步骤见 README.md 的 Install 章节。
步骤 4(可选):世界生成的额外依赖
只有需要跑"文字/图片 → 3D 世界"的生成流程时才需要执行:
# git 依赖需先装好 torch/CUDA pip install --no-build-isolation -r requirements_git.txt # recastnavigation 通过 git submodule 管理,用于轨迹规划 git submodule update --init --recursive # Recast navmesh 扩展 cd hyworld2/worldgen/third_party/navmesh pip install . --no-build-isolation cd ../../../../此外,世界生成还需要一个部署好的 vLLM 视觉语言模型服务(如 Qwen3-VL-8B)供轨迹规划阶段调用,完整示例见 hyworld2/worldgen/README.md。
步骤 5(可选):全景生成 HY-Pano 2.0
全景模块有独立的安装方式与两套推理后端,请参照 hyworld2/panogen/README.md 完成安装。
三、第一次运行:WorldMirror 2.0 多视角 3D 重建
最简单的 Gradio Web 演示(一条命令)
python -m hyworld2.worldrecon.gradio_app浏览器打开后,上传图片或视频,即可直接可视化 3DGS、点云、深度图、法线图和相机参数——零代码上手世界重建。完整参数(端口、本地检查点等)见 hyworld2/worldrecon/gradio_app.py。
命令行与 Python API
# 单卡推理 python -m hyworld2.worldrecon.pipeline --input_path path/to/imagesfrom hyworld2.worldrecon.pipeline import WorldMirrorPipeline pipeline = WorldMirrorPipeline.from_pretrained('tencent/HY-World-2.0') result = pipeline('path/to/images')输入就是一个多视角图片目录(或一段视频)。仓库自带示例场景可直接试用,如 examples/worldrecon/realistic/Flower/image_0001.jpg:
⚠️ 多卡模式下,输入图片数量必须≥ GPU 数量(如 8 卡至少提供 8 张图)。
输出产物:点云、深度、3DGS 与相机参数
单次前向推理即可同时得到(默认输出至inference_output):
gaussians.ply— 3D 高斯泼溅(可直接导入引擎渲染)points.ply— 彩色点云camera_params.json— 相机外参与内参- 逐视角深度图 / 法线图(PNG 可视化 + 原始数值)
视频 → 3D 数字孪生的重建效果如下:
四、世界生成:从文字/图片到可探索 3D 世界的五阶段流水线
这是 HY-World 2.0 的高光环节:先由HY-Pano 2.0把文字或单图扩展为 360° 全景,再经五个阶段变成可漫游的世界。
全景生成:HY-Pano 2.0
提供diffusers风格的 Python API,几行代码即可生成全景图(输入可以是文本或图片):
from pipeline import HunyuanPanoPipeline pipeline = HunyuanPanoPipeline.from_pretrained('tencent/HY-World-2.0') output = pipeline('input.png') output.save('output_panorama.png')生成结果即 360° 等距柱状投影全景图,仓库示例场景 examples/worldgen/case000/panorama.png 就是一个典型输入:
五阶段流水线:从轨迹规划到 3DGS 训练
全景就绪后,世界生成流程按顺序执行(各阶段共用同一--target_path场景目录,中间结果逐步落盘,便于排查):
| 阶段 | 脚本 | 作用 |
|---|---|---|
| 1. 轨迹规划 | traj_generate.py | VLM 引导的相机轨迹规划,障碍物感知导航 |
| 2. 轨迹渲染 | traj_render.py | 沿规划轨迹做多卡点云渲染 |
| 3. 世界扩展 | video_gen.py | WorldStereo 2.0 生成记忆一致性关键帧 |
| 4. GS 数据准备 | gen_gs_data.py | 提取帧、对齐深度、法线与相机参数 |
| 5. 3DGS 训练 | world_gs_trainer.py | 优化并导出最终 3DGS 世界(支持网格导出) |
完整命令模板(含多卡torchrun与 FSDP 参数)见 hyworld2/worldgen/README.md。
⚠️ 世界生成建议 ≥4 GPU(官方在 8×H20 上验证);GPU 更少时请等比增大训练步数(README 中已给出 1/2/4 卡对应的步数建议)。
探索世界:交互式查看器与网格导出
训练完成后,一条命令启动基于浏览器的交互式 3DGS 查看器:
python show_gs.py --port 8081 --gpu_id 0 --ckpt "$RESULT_DIR/ckpts/ckpt_1499_rank*.pt"训练出的 3D 世界支持第一人称物理漫游,效果如下:
世界同样可以导出为网格(mesh),方便导入 Blender 等工具二次创作:
以下画面均为真实 3D 资产(而非生成视频),截取自实时交互渲染:
五、环境搭建常见问题 FAQ
Q1:重建和生成各需要多大算力?WorldMirror 2.0 约 1.2B 参数,单卡即可推理,多卡 FSDP 可进一步加速;WorldStereo 2.0 约 17B 参数,世界生成全流程推荐 ≥4 卡。
Q2:多卡重建为什么报错?检查输入图片数量是否 ≥ GPU 数量,这是多卡模式的硬性要求。
Q3:模型权重要手动下载吗?不需要。WorldMirror 2.0、HY-Pano 2.0、WorldStereo 2.0 的权重均支持首次运行自动下载。
Q4:想深入查看参数、输出格式与先验注入?完整 API / CLI 参数参考(含相机与深度先验注入、Gradio 参数)见 DOCUMENTATION.md。
六、文档与代码索引
| 资料 | 路径 |
|---|---|
| 项目总览与安装指南 | README.md |
| 详细文档(API / CLI / 输出格式) | DOCUMENTATION.md |
| 世界重建模块源码 | hyworld2/worldrecon/ |
| 世界重建推理入口 | hyworld2/worldrecon/pipeline.py |
| 世界生成模块(五阶段脚本) | hyworld2/worldgen/ |
| 全景生成模块 | hyworld2/panogen/ |
| 重建示例场景 | examples/worldrecon/ |
| 世界生成示例场景 | examples/worldgen/ |
按上面的步骤走一遍,你已经在本地跑通了从"几张照片 → 3D 世界重建",并掌握了"一句文字 → 可探索 3D 世界"的完整路径。Happy World Building! 🌍
【免费下载链接】HY-World-2.0HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds项目地址: https://gitcode.com/gh_mirrors/hy/HY-World-2.0
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考