☰
ComfyUI全方位指南(6)Z-Image ComfyUI学习实录(Ubuntu24.04+Tesla V100 16G环境)
2026/10/1 18:56:25 网站建设 项目流程

一、说明

Z-Image (造相)是一款由阿里巴巴通义实验室开发的强大且高效的6B参数图像生成模型。它采用了可扩展单流 DiT(S3-DiT) 架构,将文本、视觉语义 Token 和图像 VAE Token 在序列级别进行拼接,作为统一的输入流,从而最大限度地提高了参数效率。 Z-Image (Base) 是非蒸馏的基础模型,专为社区驱动的微调和定制开发而设计。

模型亮点:

  • 逼真画质:提供强大的逼真图像生成能力,同时保持出色的审美质量
  • 精确的双语文本渲染:擅长准确呈现复杂的中文和英文文本
  • 提示词增强与推理:提示词增强器 (Prompt Enhancer) 赋予模型推理能力
  • 支持微调:是进行定制训练和适配的理想基础模型

二、文生图

1、模型

📂 ComfyUI/ ├── 📂 models/ │ ├── 📂 text_encoders/ │ │ └── qwen_3_4b.safetensors │ ├── 📂 diffusion_models/ │ │ └── z_image_bf16.safetensors │ └── 📂 vae/ │ └── ae.safetensors

如何下载前面章节有说明,不再重复

2、用官方模板

[INFO] Prompt executed in 318.64 seconds

上面是自带提示词参数生成的图,还可以,后面我们做一下修改

3、修改参数以及提示词

我们的目标是生成关之琳年轻时候的照片,看看她有多美

港风人像高清9:16最优参数:

我们通过找资料获取这些信息,后面可以试试,实践出真知喔

📐核心分辨率配置

  • ‌宽高比‌:保持9:16竖屏比例,适配手机人像构图
  • ‌百万像素‌:调整至2.0,对应像素尺寸约为900×1600,兼顾生成速度与基础画质
  • ‌放大倍数‌:设置为8倍,在保留原生胶片质感的同时,大幅提升面部发丝、港风服饰纹理的精细度,避免过度放大导致的画面失真。本来想设置为4倍,发现8最小了

✨ 配套生成提示词优化

九十年代港风老胶片质感,年轻时的关之琳留经典大波浪卷发,身着复古港风连衣裙,站在暖调霓虹柔光背景前,神态温婉清丽,妆容淡雅自然,画面柔和细腻,人像主体突出,胶片颗粒感均匀,色彩还原九十年代复古色调。

Z_IMAGE 可以直接用中文,支持得很好

运行,慢很慢,下一篇试试turbo,会不会快很多

[INFO] Prompt executed in 515.06 seconds

换换提示词:九十年代港风老胶片复古质感,温婉清丽的关之琳,经典大波浪造型,淡雅妆容,柔和细腻画面,简洁雅致背景,细节清晰自然

将宽高比改为16:9

运行:

三、文生图int8

wget -P /home/jjj/ComfyUI/models/diffusion_models https://hf-mirror.com/Comfy-Org/z_image/resolve/main/split_files/diffusion_models/z_image_int8_convrot.safetensors

[INFO] Prompt executed in 220.27 seconds

和模板差不多

我们用前面的提示词:

九十年代港风老胶片质感,年轻时的关之琳留经典大波浪卷发,身着复古港风连衣裙,站在暖调霓虹柔光背景前,神态温婉清丽,妆容淡雅自然,画面柔和细腻,人像主体突出,胶片颗粒感均匀,色彩还原九十年代复古色调

[INFO] Prompt executed in 121.82 seconds

四、z_image_turbo_bf16与z_image_turbo_int8区别

这两个是阿里Z-Image-Turbo文生图模型的不同量化版本,核心差异集中在精度、资源占用和生成表现上。

📊 基础参数与硬件门槛差异

表格

维度z_image_turbo_bf16.safetensorsz_image_turbo_int8.safetensors
精度格式16位Brain Floating Point浮点格式8位整数量化格式
模型文件大小约12.3GB约5~6GB
最低显存需求16GB+6~8GB
数值稳定性保留FP32级动态范围,几乎不会出现黑图、数值溢出问题整数映射校准后稳定性尚可,极端场景下可能出现细节失真

✨ 生成质量与速度表现差异

  • ‌BF16版本‌:画质保留100%基准水平,色彩还原精准,发丝、纹理等高频细节完整,FID分数约12.5,是官方原生的高质量基准版本。单图生成耗时约3.2秒,速度作为基准参照。
  • ‌INT8版本‌:画质保留约90%~93%,在普通提示词下肉眼差异不大,但复杂光影、精细人像场景下可能出现轻微细节模糊,FID分数约16.8。单图生成耗时约1.9秒,速度比BF16版本快40%左右。

🎯 适用场景差异

  • ‌BF16版本‌:推荐RTX 4080/4090、专业级GPU使用,适合专业创作、追求极致画质的场景,比如商业人像、高精度艺术作品生成。
  • ‌INT8版本‌:推荐RTX 3060/4060等8GB显存消费级显卡使用,适合快速迭代测试提示词、批量生成预览图,在低显存设备上也能流畅跑通。

五、Z-Image-Turbo 显卡版本选型速查表

表格

量化格式显存需求画质保留比例速度提升倍率推荐适配硬件
BF16(原始版)~16GB100%基准参照RTX 4080/4090、专业级GPU
FP8 Scaled~6GB95-98%1.2倍RTX 3060/4060/3070
SVDQ INT4 (r256)4-5GB90-93%2-3倍RTX 2060/3050
SVDQ FP4 (r128)3-4GB85-90%3倍RTX 5xxx系列(实验性)

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询