今天展示的案例是一个基于Omnigen2的 ComfyUI 工作流。整个流程通过加载预训练模型、输入正负提示词、结合噪声与采样策略,生成高清图像,并最终保存输出。
该工作流核心突出的是对文本提示的精准理解与图像风格的可控性,读者能够直观感受到从文本到图像的转化过程,以及不同节点之间的协作如何保证画面质量。
文章目录
- 工作流介绍
- 核心模型
- Node节点
- 工作流程
- 大模型应用
- CLIPTextEncode 文本语义嵌入生成
- CLIPTextEncode (Negative Prompt) 负向语义控制
- 使用方法
- 应用场景
- 开发与应用
工作流介绍
这个工作流采用了UNet 主模型、CLIP 文本编码器以及 VAE 解码器的协作方式,将提示词经过编码转化为条件输入,再结合噪声与调度器完成扩散采样,生成符合描述的高质量图像。核心模型不仅提供了稳定的扩散生成能力,也保证了语义理解的准确性。
核心模型
在模型部分,Omnigen2 作为主要扩散模型,配合 qwen_2.5_vl_fp16 文本编码器和 ae VAE 解码器,实现了文本语义解析、潜空间计算与最终图像解码的完整链路。表格展示了核心模型的组成与作用。
| 模型名称 | 说明 |
|---|---|
| omnigen2_fp16.safetensors | 核心扩散模型,负责潜空间的逐步采样与图像生成 |
| qwen_2.5_vl_fp16.safetensors | 文本编码器,将提示词与负面提示转化为条件向量 |
| ae.safetensors | VAE 模型,用于潜空间图像的解码与高质量画面还原 |