一、说明
Z-Image (造相)是一款由阿里巴巴通义实验室开发的强大且高效的6B参数图像生成模型。它采用了可扩展单流 DiT(S3-DiT) 架构,将文本、视觉语义 Token 和图像 VAE Token 在序列级别进行拼接,作为统一的输入流,从而最大限度地提高了参数效率。 Z-Image (Base) 是非蒸馏的基础模型,专为社区驱动的微调和定制开发而设计。
模型亮点:
- 逼真画质:提供强大的逼真图像生成能力,同时保持出色的审美质量
- 精确的双语文本渲染:擅长准确呈现复杂的中文和英文文本
- 提示词增强与推理:提示词增强器 (Prompt Enhancer) 赋予模型推理能力
- 支持微调:是进行定制训练和适配的理想基础模型
二、文生图
1、模型
📂 ComfyUI/ ├── 📂 models/ │ ├── 📂 text_encoders/ │ │ └── qwen_3_4b.safetensors │ ├── 📂 diffusion_models/ │ │ └── z_image_bf16.safetensors │ └── 📂 vae/ │ └── ae.safetensors
如何下载前面章节有说明,不再重复
2、用官方模板
[INFO] Prompt executed in 318.64 seconds
上面是自带提示词参数生成的图,还可以,后面我们做一下修改
3、修改参数以及提示词
我们的目标是生成关之琳年轻时候的照片,看看她有多美
港风人像高清9:16最优参数:
我们通过找资料获取这些信息,后面可以试试,实践出真知喔
📐核心分辨率配置
- 宽高比:保持9:16竖屏比例,适配手机人像构图
- 百万像素:调整至2.0,对应像素尺寸约为900×1600,兼顾生成速度与基础画质
- 放大倍数:设置为8倍,在保留原生胶片质感的同时,大幅提升面部发丝、港风服饰纹理的精细度,避免过度放大导致的画面失真。本来想设置为4倍,发现8最小了
✨ 配套生成提示词优化
九十年代港风老胶片质感,年轻时的关之琳留经典大波浪卷发,身着复古港风连衣裙,站在暖调霓虹柔光背景前,神态温婉清丽,妆容淡雅自然,画面柔和细腻,人像主体突出,胶片颗粒感均匀,色彩还原九十年代复古色调。
Z_IMAGE 可以直接用中文,支持得很好
运行,慢很慢,下一篇试试turbo,会不会快很多
[INFO] Prompt executed in 515.06 seconds
换换提示词:九十年代港风老胶片复古质感,温婉清丽的关之琳,经典大波浪造型,淡雅妆容,柔和细腻画面,简洁雅致背景,细节清晰自然
将宽高比改为16:9
运行:
三、文生图int8
wget -P /home/jjj/ComfyUI/models/diffusion_models https://hf-mirror.com/Comfy-Org/z_image/resolve/main/split_files/diffusion_models/z_image_int8_convrot.safetensors
[INFO] Prompt executed in 220.27 seconds
和模板差不多
我们用前面的提示词:
九十年代港风老胶片质感,年轻时的关之琳留经典大波浪卷发,身着复古港风连衣裙,站在暖调霓虹柔光背景前,神态温婉清丽,妆容淡雅自然,画面柔和细腻,人像主体突出,胶片颗粒感均匀,色彩还原九十年代复古色调
[INFO] Prompt executed in 121.82 seconds
四、z_image_turbo_bf16与z_image_turbo_int8区别
这两个是阿里Z-Image-Turbo文生图模型的不同量化版本,核心差异集中在精度、资源占用和生成表现上。
📊 基础参数与硬件门槛差异
表格
| 维度 | z_image_turbo_bf16.safetensors | z_image_turbo_int8.safetensors |
|---|---|---|
| 精度格式 | 16位Brain Floating Point浮点格式 | 8位整数量化格式 |
| 模型文件大小 | 约12.3GB | 约5~6GB |
| 最低显存需求 | 16GB+ | 6~8GB |
| 数值稳定性 | 保留FP32级动态范围,几乎不会出现黑图、数值溢出问题 | 整数映射校准后稳定性尚可,极端场景下可能出现细节失真 |
✨ 生成质量与速度表现差异
- BF16版本:画质保留100%基准水平,色彩还原精准,发丝、纹理等高频细节完整,FID分数约12.5,是官方原生的高质量基准版本。单图生成耗时约3.2秒,速度作为基准参照。
- INT8版本:画质保留约90%~93%,在普通提示词下肉眼差异不大,但复杂光影、精细人像场景下可能出现轻微细节模糊,FID分数约16.8。单图生成耗时约1.9秒,速度比BF16版本快40%左右。
🎯 适用场景差异
- BF16版本:推荐RTX 4080/4090、专业级GPU使用,适合专业创作、追求极致画质的场景,比如商业人像、高精度艺术作品生成。
- INT8版本:推荐RTX 3060/4060等8GB显存消费级显卡使用,适合快速迭代测试提示词、批量生成预览图,在低显存设备上也能流畅跑通。
五、Z-Image-Turbo 显卡版本选型速查表
表格
| 量化格式 | 显存需求 | 画质保留比例 | 速度提升倍率 | 推荐适配硬件 |
|---|---|---|---|---|
| BF16(原始版) | ~16GB | 100% | 基准参照 | RTX 4080/4090、专业级GPU |
| FP8 Scaled | ~6GB | 95-98% | 1.2倍 | RTX 3060/4060/3070 |
| SVDQ INT4 (r256) | 4-5GB | 90-93% | 2-3倍 | RTX 2060/3050 |
| SVDQ FP4 (r128) | 3-4GB | 85-90% | 3倍 | RTX 5xxx系列(实验性) |