☰
HY-World 2.0 快速开始完整指南:10分钟搭建环境,从文字/图片到可探索3D世界
2026/10/2 16:23:37 网站建设 项目流程

HY-World 2.0 快速开始完整指南:10分钟搭建环境,从文字/图片到可探索3D世界

【免费下载链接】HY-World-2.0HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds项目地址: https://gitcode.com/gh_mirrors/hy/HY-World-2.0

HY-World 2.0是一个开源的多模态 3D 世界模型(World Model)框架:输入一句文字或一张图片,就能生成可自由漫游的真实 3D 世界(3DGS / 网格);输入多视角图片或一段视频,即可瞬间完成 3D 重建。本指南带你 10 分钟完成环境搭建,跑通第一次 3D 世界重建,并了解「文字/图片 → 可探索 3D 世界」的完整生成流程。

一、2分钟认识 HY-World 2.0:输出"真 3D 资产"的世界模型

HY-World 2.0 提供两大核心能力:

能力输入输出
🌍世界生成(World Generation)文字 / 单张图片360° 全景 → 可导航 3D 世界(3DGS / 网格)
📷世界重建(World Reconstruction)多视角图片 / 视频深度图、法线、点云、相机参数、3DGS

与"生成像素视频"的世界模型不同,HY-World 2.0 产出的是可编辑、可持久化的真实 3D 资产:消费级 GPU 即可实时渲染漫游,并能直接导入 Blender / Unity / Unreal Engine。下图展示了这套 3D 世界模型的生成与重建效果:

整个系统是一条流水线:全景生成(HY-Pano 2.0)→ 轨迹规划(WorldNav)→ 世界扩展(WorldStereo 2.0)→ 世界组合(WorldMirror 2.0 + 3DGS 学习),最终把文字或单张图像自动转化为高保真、可漫游的 3D 世界。

二、10分钟环境搭建:CUDA 12.8 + Python 3.11 安装步骤

环境要求一览

项目建议配置
GPUNVIDIA 显卡(CUDA 12.8);重建单卡可跑,生成推荐 ≥4 卡
系统Linux(推荐)
Python3.11+(conda 环境python=3.11.15)
磁盘模型权重首次运行自动下载(WorldStereo 2.0 约 17B 参数),建议预留充足空间

💡 无需手动下载任何模型权重,首次运行会自动拉取,这也是"10 分钟起步"的关键。

步骤 1:克隆仓库并创建 conda 环境

git clone https://gitcode.com/gh_mirrors/hy/HY-World-2.0 cd HY-World-2.0 conda create -n hyworld2 python=3.11.15 conda activate hyworld2

步骤 2:安装 worldrecon 基础依赖(WorldMirror 2.0)

这一步完成后,环境即可运行世界重建模块:

# 基础依赖(worldrecon 与 worldgen 共用) pip install -r requirements.txt # 推荐:安装一次自定义 gsplat 渲染后端,重建与生成共用 cd hyworld2/worldgen/third_party/gsplat_maskgaussian pip install -e . --no-build-isolation cd ../../../../

步骤 3:安装 FlashAttention(二选一后端之一即可)

# 简单方案:FlashAttention-2 pip install flash-attn --no-build-isolation

如果你用的是 Hopper 架构 GPU(如 H100/H20),推荐从源码编译安装 FlashAttention-3,具体步骤见 README.md 的 Install 章节。

步骤 4(可选):世界生成的额外依赖

只有需要跑"文字/图片 → 3D 世界"的生成流程时才需要执行:

# git 依赖需先装好 torch/CUDA pip install --no-build-isolation -r requirements_git.txt # recastnavigation 通过 git submodule 管理,用于轨迹规划 git submodule update --init --recursive # Recast navmesh 扩展 cd hyworld2/worldgen/third_party/navmesh pip install . --no-build-isolation cd ../../../../

此外,世界生成还需要一个部署好的 vLLM 视觉语言模型服务(如 Qwen3-VL-8B)供轨迹规划阶段调用,完整示例见 hyworld2/worldgen/README.md。

步骤 5(可选):全景生成 HY-Pano 2.0

全景模块有独立的安装方式与两套推理后端,请参照 hyworld2/panogen/README.md 完成安装。

三、第一次运行:WorldMirror 2.0 多视角 3D 重建

最简单的 Gradio Web 演示(一条命令)

python -m hyworld2.worldrecon.gradio_app

浏览器打开后,上传图片或视频,即可直接可视化 3DGS、点云、深度图、法线图和相机参数——零代码上手世界重建。完整参数(端口、本地检查点等)见 hyworld2/worldrecon/gradio_app.py。

命令行与 Python API

# 单卡推理 python -m hyworld2.worldrecon.pipeline --input_path path/to/images
from hyworld2.worldrecon.pipeline import WorldMirrorPipeline pipeline = WorldMirrorPipeline.from_pretrained('tencent/HY-World-2.0') result = pipeline('path/to/images')

输入就是一个多视角图片目录(或一段视频)。仓库自带示例场景可直接试用,如 examples/worldrecon/realistic/Flower/image_0001.jpg:

⚠️ 多卡模式下,输入图片数量必须≥ GPU 数量(如 8 卡至少提供 8 张图)。

输出产物:点云、深度、3DGS 与相机参数

单次前向推理即可同时得到(默认输出至inference_output):

  • gaussians.ply— 3D 高斯泼溅(可直接导入引擎渲染)
  • points.ply— 彩色点云
  • camera_params.json— 相机外参与内参
  • 逐视角深度图 / 法线图(PNG 可视化 + 原始数值)

视频 → 3D 数字孪生的重建效果如下:

四、世界生成:从文字/图片到可探索 3D 世界的五阶段流水线

这是 HY-World 2.0 的高光环节:先由HY-Pano 2.0把文字或单图扩展为 360° 全景,再经五个阶段变成可漫游的世界。

全景生成:HY-Pano 2.0

提供diffusers风格的 Python API,几行代码即可生成全景图(输入可以是文本或图片):

from pipeline import HunyuanPanoPipeline pipeline = HunyuanPanoPipeline.from_pretrained('tencent/HY-World-2.0') output = pipeline('input.png') output.save('output_panorama.png')

生成结果即 360° 等距柱状投影全景图,仓库示例场景 examples/worldgen/case000/panorama.png 就是一个典型输入:

五阶段流水线:从轨迹规划到 3DGS 训练

全景就绪后,世界生成流程按顺序执行(各阶段共用同一--target_path场景目录,中间结果逐步落盘,便于排查):

阶段脚本作用
1. 轨迹规划traj_generate.pyVLM 引导的相机轨迹规划,障碍物感知导航
2. 轨迹渲染traj_render.py沿规划轨迹做多卡点云渲染
3. 世界扩展video_gen.pyWorldStereo 2.0 生成记忆一致性关键帧
4. GS 数据准备gen_gs_data.py提取帧、对齐深度、法线与相机参数
5. 3DGS 训练world_gs_trainer.py优化并导出最终 3DGS 世界(支持网格导出)

完整命令模板(含多卡torchrun与 FSDP 参数)见 hyworld2/worldgen/README.md。

⚠️ 世界生成建议 ≥4 GPU(官方在 8×H20 上验证);GPU 更少时请等比增大训练步数(README 中已给出 1/2/4 卡对应的步数建议)。

探索世界:交互式查看器与网格导出

训练完成后,一条命令启动基于浏览器的交互式 3DGS 查看器:

python show_gs.py --port 8081 --gpu_id 0 --ckpt "$RESULT_DIR/ckpts/ckpt_1499_rank*.pt"

训练出的 3D 世界支持第一人称物理漫游,效果如下:

世界同样可以导出为网格(mesh),方便导入 Blender 等工具二次创作:

以下画面均为真实 3D 资产(而非生成视频),截取自实时交互渲染:

五、环境搭建常见问题 FAQ

Q1:重建和生成各需要多大算力?WorldMirror 2.0 约 1.2B 参数,单卡即可推理,多卡 FSDP 可进一步加速;WorldStereo 2.0 约 17B 参数,世界生成全流程推荐 ≥4 卡。

Q2:多卡重建为什么报错?检查输入图片数量是否 ≥ GPU 数量,这是多卡模式的硬性要求。

Q3:模型权重要手动下载吗?不需要。WorldMirror 2.0、HY-Pano 2.0、WorldStereo 2.0 的权重均支持首次运行自动下载。

Q4:想深入查看参数、输出格式与先验注入?完整 API / CLI 参数参考(含相机与深度先验注入、Gradio 参数)见 DOCUMENTATION.md。

六、文档与代码索引

资料路径
项目总览与安装指南README.md
详细文档(API / CLI / 输出格式)DOCUMENTATION.md
世界重建模块源码hyworld2/worldrecon/
世界重建推理入口hyworld2/worldrecon/pipeline.py
世界生成模块(五阶段脚本)hyworld2/worldgen/
全景生成模块hyworld2/panogen/
重建示例场景examples/worldrecon/
世界生成示例场景examples/worldgen/

按上面的步骤走一遍,你已经在本地跑通了从"几张照片 → 3D 世界重建",并掌握了"一句文字 → 可探索 3D 世界"的完整路径。Happy World Building! 🌍

【免费下载链接】HY-World-2.0HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds项目地址: https://gitcode.com/gh_mirrors/hy/HY-World-2.0

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询