今天给大家展示一个基于 ComfyUI 的高级视频生成工作流 ——《Wan2.2 Insight关键词与参考图动态变装》。本工作流以图像参考为起点,结合关键词提示和多种参数控制策略,自动生成具有风格化视觉语言的视频片段。
它通过模型理解参考图的构图、人物特征、场景语义等信息,再配合 LLM 的动态提示词构造和多模态嵌入,引导画面中的人物完成指定动作或变装。这一流程不仅提升了动画生成的真实感和一致性,还能根据关键词灵活控制镜头语言和视觉风格,实现创意驱动的自动视频内容生产。
文章目录
- 工作流介绍
- 核心模型
- Node节点
- 工作流程
- 大模型应用
- RH_LLMAPI_NODE 参考图驱动的动作提示词生成
- Wan22PromptSelector 结构化视频提示词生成
- WanVideoTextEncode 文本语义编码
- 使用方法
- 应用场景
- 开发与应用
工作流介绍
本工作流融合图像语义理解、提示词自动生成、风格化处理与时间线控制,目标是将静态参考图转化为具有动态表现力的短视频。其最大特点在于“提示词自动构造 + 图像参考驱动 + 模型控制解耦”,用户可通过选择场景、情绪、运动等关键词,快速定义视觉剧本;系统会自动组合 Prompt,并将其编码为视频模型所需的嵌入信息。整个流程无缝衔接文本、图像、嵌入、采样、解码等关键阶段,具有极高的拓展性。
核心模型
本工作流主要使用WanVideoModel系列的多个子模型作为核心生成引擎,搭配WanTextEncoder进行提示词编码。模型不仅支持高保真图像生成,还能处理时间维度上的动作连续性,确保画面过渡自然流畅。
| 模型名称 | 说明 |
|---|---|
| WanVideoModel (model_3 / model_4) | 用于图像序列的采样与合成,支持高质量的视频生成 |
| WanTextEncoder (wan_t5_model_2) | 文本提示词编码器,将自然语言转化为视频模型可读的嵌入向量 |