如果你最近在关注 AI 视频生成,应该已经注意到一个现象:单纯的“文生视频”已经不够看了,大家都在研究“可控生成”。同样的模型,有的人只能生成毫无构图逻辑的随机画面,有的人却能稳定产出同一风格、同一角色、同一服装质感的系列内容。差别到底在哪里?
最近一个叫“图图的嗨丝系列”的项目在相关社区里被频繁讨论:作者用 MiniMax H3 和 KREA2 配合,产出了 200 段视频、186 张图片,并且整理了一份包含 18694 条提示词的资源包。很多人第一反应是“这又是一批擦边素材”,但如果真的去看技术细节,会发现这是一个非常典型的多模型协作 + 提示词工程 + 工作流复用的案例。它真正值得关注的不是“嗨丝”这个题材,而是:一套固定的视觉风格,如何通过模型的组合与提示词的标准化,被稳定复现上百次。
这篇文章我会拆解这套项目的技术逻辑,包括 MiniMax H3 本地部署时需要注意什么、KREA2 在整个流程里承担什么角色、18694 条提示词包应该如何组织才不是垃圾堆,以及如果你也想做类似“单一视觉风格的大规模产出”项目,到底应该怎么搭工作流、怎么验证效果、怎么排查问题。
1. 这套“嗨丝系列”项目到底在做什么
先不要被标题带偏。如果把“嗨丝”“黑丝”这些题材词替换成“赛博朋克”“中国风”“废土机械”,你会发现这个项目本质上是一个风格化内容的批量生产实验:
- 用 MiniMax H3 生成 200 段视频;
- 用 KREA2 生成/处理 186 张静态图;
- 通过一套提示词包(18694 条)把生成结果约束在“极光黑丝”这个统一视觉方向里;
- 最终形成可复用的工作流和素材库。
这个思路在商业项目里非常常见。比如淘宝详情页需要固定模特风格的视频素材,游戏宣发需要统一角色的批量立绘,短视频矩阵需要同一账号风格的连续产出。只是大多数人把这些需求交给人工后期,而这类项目尝试用模型组合去规模化解决。
从技术角度看,这个项目有四个关键决策点:
第一,为什么选择 MiniMax H3。从社区讨论看,MiniMax H3 是一个支持视频生成的开源模型,近期热度集中在本地部署、ComfyUI 整合包、8G 显存运行、33B 版本这些关键词上。这意味着它不是一个只能在线调用的 API,而是可以被开发者和创作者拉到自己机器上跑的开源模型。对于批量生成需求来说,这是一个非常重要的前提:只有本地部署,才能不受单次生成次数限制,才能低成本地跑出 200 段视频。
第二,KREA2 在整个流程中解决的是“调度与精修”问题。从公开信息看,KREA2 相关讨论集中在“调度器”“LoRA”“风格控制”上,它更接近一个图像或视频的精细化控制工具。在很多实际工作流里,视频生成模型负责“动起来”,但画面的最终质感、风格一致性、细节纹理,需要靠图像模型或 LoRA 来兜底。
第三,18694 条提示词不是“随手写出来的”,而是分层分类的。如果只是把 18000 多条提示词堆在一个文本文件里,那毫无价值。这个数量级背后一定有一套模板逻辑:固定风格词 + 内容变量 + 负面提示词 + 局部控制词。
第四,200 段视频 + 186 张图片的组合意味着一个稳定的生成流程。不是每条提示词都能一次成功,能产出这个量级的内容,说明背后一定有筛选、重试、参数调整的机制。
这篇文章的核心判断是:这个项目值钱的不是“嗨丝”素材本身,而是它展示了一条“用开源模型稳定批量产出统一风格内容”的技术路径。这套路径可以迁移到任何垂直风格领域。
2. MiniMax H3 与 KREA2:视频生成与图片风格的组合逻辑
要理解这套项目,先要分清 MiniMax H3 和 KREA2 在流程中的不同角色。很多新手容易把“视频生成模型”和“图片生成模型”混为一谈,实际上在成熟的批量内容生产流程里,它们的职责完全不同。
2.1 MiniMax H3 的定位:时序内容生成
MiniMax H3 在社区里的讨论集中在“视频生成模型”“本地部署”“ComfyUI 整合包”“33B”这些关键词。可以把它理解为一个能根据文本描述生成视频片段的模型。它的核心能力是理解一段提示词中描述的“发生了什么”,然后把静态的画面推演成一段有时序变化的动态内容。
比如你输入“一个身穿黑色丝质连衣裙的女性站在极光背景前,头发被风吹动,眼神看向镜头”,MiniMax H3 要做的不是画一张图,而是生成一个符合这个描述的动态片段,可能是几秒钟,也可能更长,取决于模型能力和部署配置。
从热词里的“导演台”“工作流”来看,MiniMax H3 的完整使用往往不只是一个模型单独运行,而是配合 ComfyUI 这样的节点式工作流工具,把视频生成拆分成多个节点:文本编码、图像条件输入、视频生成、帧插值、放大、导出。
这里还有一个关键信息:MiniMax H3 支持Ref2VA 全能参考模式。通俗讲,这就像是给模型“喂”了一张参考图,让它在生成视频时尽量保持参考图的构图、色调和人物特征。这一点对于“嗨丝系列”这种要求统一视觉风格的项目来说非常重要。200 段视频如果每段都长得完全不一样,那就不叫系列,只能叫碎片。
2.2 KREA2 的定位:调度、LoRA 与风格收敛
KREA2 相关热搜词包括“调度器”“LoRA”“OneTrainer”,这说明它在工作流里承担的是更偏“图像控制”的职责。调度器决定了生成过程中的降噪步数安排和采样策略,LoRA 则是用少量图片训练出的轻量模型,用于把生成结果收敛到某种特定风格。
举个例子。如果 MiniMax H3 本身是“全能选手”,它什么风格都能生成,但它不会为了“极光黑丝”这个非常聚焦的风格单独优化。而用一批“极光黑丝”风格的高质量图片训练出来的 KREA2 LoRA,相当于给模型加了一个“风格滤镜”,让每次生成都自动带上这种特定质感。
在完整的项目工作流里,它的角色可以理解为:
- MiniMax H3:负责生成视频主体内容;
- KREA2:负责在生成前控制风格方向,在生成后修复画面细节;
- LoRA:负责把“极光黑丝”这种视觉特征固化下来;
- 调度器:负责控制生成过程的稳定性,减少画面崩坏。
2.3 什么场景需要这种“双模型组合”
以“嗨丝系列”为例,单个模型也能生成“黑丝”题材,但如果目标是从不同角度、不同场景、不同动作批量生成 200 段视频,只靠单个模型的随机发挥几乎不可能保持统一质感。这正是双模型组合的意义:
- 单一模型适合“一次性创意探索”,但结果不可控;
- 双模型组合适合“固定风格的批量生产”,因为每个模型各管一段,互相制约,结果更稳定。
把这个逻辑推广开,不管你做的题材是黑丝还是国风汉服,是机械战甲还是古建筑,只要目标是“同一风格下的大量内容产出”,双模型组合就是比单模型更可靠的方案。
3. 常见误区:不是模型强,而是工作流强
在看这类项目时,新手最容易犯一个错误:以为只要下载了 MiniMax H3 和 KREA2,就能直接生成出同款效果。实际上,这种“200 段视频 + 186 张图片”级别的产出,背后真正起作用的是一整套可重复执行的工作流,模型只是工作流里的组件。
3.1 误区一:把提示词包当成“咒语大全”
很多人看到 18694 条提示词包,第一反应是“我拿到这个提示词包,就能生成同款”。但提示词不是魔法咒语,它们是在特定模型、特定 LoRA、特定参数、特定参考图条件下才有效的“配置信息”。
把 MiniMax H3 的提示词直接拿到另一个视频模型里用,效果大概率很差。因为不同模型的训练数据、文本编码器、风格偏好都不一样。提示词包的价值,是告诉你“这套风格需要从哪些维度去描述”,而不是给你一个通用万能答案。
3.2 误区二:忽略负面提示词和参数设置
很多提示词包里只统计了“正向提示词”,但实际创作中,负面提示词同样重要。比如生成丝袜材质时,如果不写清“不要反光过度”“不要皮肤纹理错误”“不要变形”,生成结果经常会崩。
另外,采样步数、CFG、分辨率、帧率这些参数也会直接影响输出质量。同一条提示词,在 8GB 显存和 16GB 显存的机器上跑出来可能天差地别,这并不完全是模型的问题,而是参数没有根据硬件条件调整。
3.3 误区三:忽略筛选和二次加工
200 段视频是最终产出吗?不一定。在真实的批量生成项目里,通常是先生成 500 到 1000 个候选视频,再人工筛选出 200 个相对合格的,最后还会做帧间修复、色彩统一、清晰度增强等后期处理。模型只是生产线的前半段,筛选和修图修视频是后半段。
4. 环境准备与本地部署方案
如果你想复现这个项目,或者把它的技术路径迁移到自己的垂直风格领域,第一步是搭好环境。
4.1 硬件要求
从社区讨论的“8G 底显存”来看,MiniMax H3 是可以跑在消费级显卡上的,但需要做量化或优化。按照通行经验,可以这么对应:
- 8GB 显存:可以跑,但需要低分辨率、低帧数,或者使用量化版本;
- 12GB 到 16GB 显存:比较舒适,能跑中高分辨率;
- 24GB 及以上:可以尝试更高分辨率、更多帧数、更大批量。
需要注意的是,视频生成的显存占用不是线性增长的。分辨率从 640 提升到 1080,显存占用可能翻三倍以上。因此建议刚开始不要追求高清,先用小分辨率跑通流程。
4.2 软件环境主体思路
MiniMax H3 的本地部署,目前社区的主流做法是借助 ComfyUI 整合包,而不是直接用命令行。原因很实际:ComfyUI 把模型加载、提示词输入、视频导出、LoRA 挂载全部做成了可视化的节点,排查问题时直观很多。
如果你以前用过 Stable Diffusion WebUI,那么对 ComfyUI 的工作方式不会陌生,但两者有一个关键区别:WebUI 偏“开箱即用”,ComfyUI 偏“工作流搭建”。对于需要反复调整的批量生成项目,ComfyUI 的优势更明显,因为你可以把整条生产链路保存为一个 workflow 文件,换提示词就能重跑。
4.3 部署步骤示意
因为没有确切的官方文档作为唯一标准,下面给出的是通用步骤思路,具体版本请以实际下载的模型和工具说明为准。
# 1. 确认显卡驱动和 Python 环境 nvidia-smi python --version # 2. 克隆 ComfyUI 并安装依赖(实际路径根据仓库变化) git clone https://github.com/comfyanonymous/ComfyUI cd ComfyUI pip install -r requirements.txt # 3. 将 MiniMax H3 模型权重放入 models 目录 # 不同工具对目录位置要求不同,建议保留原目录结构一般来说,把下载好的模型权重放到 ComfyUI 的models/checkpoints或models/diffusion_models目录下,再把对应的 LoRA 放到models/loras目录,就能在节点里挂载使用了。
4.4 底显存机器的优化思路
如果你只有 8GB 显存,可以尝试以下优化手段,这些做法在多种视频模型中都适用:
- 使用量化版本权重,比如 4bit 或 8bit,降低显存占用;
- 降低视频分辨率,先以 512 或 640 宽度起步;
- 减少单次生成的帧数,拆成短视频再后期拼接;
- 开启显存优化选项,例如 offload 到 CPU 或强制使用
--lowvram模式; - 关闭不必要的后台程序,释放显存给生成任务。
需要特别提醒:任何模型的本地部署,都要在合法授权的前提下进行。确认模型的开源协议允许商业使用,再把它用到商业项目里。
5. 提示词包的构建逻辑:18694 条如何分类
很多人最关心的就是提示词包。但真正值得分析的,不是这 18694 条内容本身,而是它的分类和组织方式。一个可复用的提示词包,通常应该包含以下几个维度。
5.1 基础风格词库
这部分是所有提示词的“公共前缀”,用来保证整体风格统一。以“极光黑丝”项目为例,基础风格词可能包括:
- 极光背景的颜色描述;
- 光线的方向和质感;
- 人物的镜头位置;
- 服装材质的特定描述;
- 画面整体色调与氛围。
这类词一旦确定,基本不会变。在整个提示词包里,它们会被批量拼接到每一条提示词前部。
5.2 内容变量词库
这是提示词包中最多的部分。200 段视频需要不同的动作、表情、角度、场景,这些变化就来自内容变量词库。可以这样理解:
- 动作:走路、回头、撩头发、转身、弯腰、侧卧;
- 表情:微笑、冷漠、惊讶、凝视镜头;
- 镜头:特写、中景、全景、低角度、高角度;
- 环境:室内、室外、极光下、街道、房间。
把这些变量排列组合,乘以基础风格词,就能得到成千上万条提示词。18694 条提示词看起来很多,但如果内容是“固定前缀 + 变量组合”生成的,规模和可维护性就完全可控。
5.3 负面提示词库
负面提示词的作用是告诉模型“不要生成什么”。在人物和材质类项目中,负面提示词通常需要包含材质变形、肢体异常、面部扭曲等描述。缺少负面提示词,生成结果的废片率会明显上升。
5.4 LoRA 触发词
如果你训练了 KREA2 的 LoRA,那么在提示词里需要加入对应的触发词,才能激活 LoRA 的效果。触发词的选择很讲究:它通常是一个在训练图片中出现频率高的、特征明显的词,这样模型才能把触发词和风格特征关联起来。
下面是一个提示词的分类组织示例:
{ "styles": { "base_style": "aurora night, black silk stockings, soft neon light, cinematic lighting", "negative_prompt": "bad anatomy, deformed hands, extra fingers, blurry texture, watermark" }, "content_variables": { "action": ["walking forward", "turning around", "looking back", "sitting on bed"], "shot_type": ["close-up", "medium shot", "full body", "low angle"], "environment": ["aurora sky", "dark room", "city street", "bedroom"] }, "lora": { "trigger_word": "krea2_aurora_silk", "weight": 0.8 } }当需要批量生成提示词时,用脚本遍历这些变量即可。这也是 18694 条提示词能够统一生成的基础。
5.5 批量生成提示词的脚本思路
如果人工写 18000 多条提示词,工作量不可想象。但用脚本拼提示词,几分钟就能生成上万个组合。下面是一个示意代码:
import itertools import json # 读取分类配置 with open("prompt_config.json", "r", encoding="utf-8") as f: config = json.load(f) base_style = config["styles"]["base_style"] negative_prompt = config["styles"]["negative_prompt"] trigger_word = config["lora"]["trigger_word"] actions = config["content_variables"]["action"] shots = config["content_variables"]["shot_type"] environments = config["content_variables"]["environment"] prompts = [] for action, shot, env in itertools.product(actions, shots, environments): prompt = f"{base_style}, {action}, {shot}, {env}, {trigger_word}" prompts.append({ "prompt": prompt, "negative_prompt": negative_prompt, "style": "aurora_black_silk" }) with open("generated_prompts.json", "w", encoding="utf-8") as f: json.dump(prompts, f, ensure_ascii=False, indent=2) print(f"Generated {len(prompts)} prompts")这个脚本会自动组合所有变量,生成一份结构化的提示词 JSON 文件,后续可以直接接入生成工作流。
6. 完整实操:从提示词到 200 段视频和 186 张图片
现在进入最关键的实操部分。假设你的环境已经部署好 MiniMax H3 和 KREA2,并且准备好了提示词包,接下来要做的就是把它们串成一条流水线。
6.1 第一步:用 KREA2 生成/筛选风格参考图
视频生成之前,先解决“风格对不对”的问题。这一步通常用 KREA2 来生成一批静态参考图,目的不是直接用于最终输出,而是用来校验 LoRA 风格是否生效、需要调整哪些词。
比如你想生成 186 张最终图片,可能要先生成 300 到 400 张候选,然后人工挑选。在这里,KREA2 的 LoRA 质量和调度器参数非常关键。
参考配置示例(ComfyUI 中的文本到图像节点参数):
{ "seed": 12345, "width": 512, "height": 768, "steps": 28, "cfg": 6.5, "sampler": "euler_ancestral", "scheduler": "karras", "lora": { "name": "krea2_aurora_silk.safetensors", "strength": 0.8 } }调度器选择上,很多社区经验建议,人物和材质细节较多的图,karras调度器比简单线性调度器更稳,不容易在降噪过程中丢失细节,但每张图的生成时间会略长。
6.2 第二步:把参考图接入 MiniMax H3 的 Ref2VA 模式
MiniMax H3 的 Ref2VA(参考图到视频)模式,是把一张或两张参考图作为输入,让视频生成模型在动画化时尽量保留参考图的构图、色调和人物特征。
这一步对应到 ComfyUI 工作流里,通常需要两个输入节点:
- 参考图输入端:接入 KREA2 生成并筛选好的静态图;
- 文本提示词端:接入提示词包中对应这条视频的文本。
实际运行截图我没法在这里展示,但工作流节点的输入输出关系可以这样理解:
文本提示词 ──→ MiniMax H3 视频生成节点 ──→ 视频输出 参考图 ────────────────────────→关键点在于:参考图决定了“画面长什么样”,提示词决定了“画面里发生什么”。两者缺一不可。
6.3 第三步:批量生成与筛选
一次只生成一条视频的效率太低了。成熟的批量生成流程通常是:
- 先做小规模测试,比如生成 10 条,确认风格稳定;
- 风格稳定后,批量提交生成任务,比如每次生成 20 到 50 条;
- 每批生成完,快速浏览缩略图或视频预览,筛掉崩坏的;
- 对通过的片段进行后处理,比如放大、调色、补帧。
对这个项目而言,200 段视频最终生成到 500 到 800 个候选项,是符合常理的。候选淘汰率在 50% 到 70% 非常正常,甚至更高。
6.4 第四步:视频后处理与图片精修
MiniMax H3 直接输出的视频,大概率分辨率有限,画质也不够细腻。所以后处理是流水线里不能省略的环节。
常用后处理手段包括:
- 使用视频放大模型提升分辨率;
- 使用补帧工具提高流畅度;
- 使用调色工具统一视频色调;
- 对镜头抖动进行稳定处理。
186 张图片的后处理相对简单,通常只需要批量放大和色彩统一。这一步可以用脚本批量完成,不需要一张张手调。
# 批量后处理示意:统一图片尺寸和色调 from PIL import Image import os input_dir = "selected_images" output_dir = "final_images" os.makedirs(output_dir, exist_ok=True) for filename in os.listdir(input_dir): if not filename.endswith(".png"): continue img = Image.open(os.path.join(input_dir, filename)) # 统一尺寸 img = img.resize((768, 1152), Image.Resampling.LANCZOS) # 简单色调统一(实际项目可根据需要做更复杂处理) img = img.convert("RGB") img.save(os.path.join(output_dir, filename.replace(".png", ".jpg")), quality=95)7. 效果验证与质量控制
批量生成项目最怕的就是“生成一大堆,能用的没几个”。这一节说说如何建立一个有效的质量控制流程。
7.1 定性质检维度
不同风格的项目,质检标准不一样。对于“嗨丝系列”这种以人物和材质为核心的项目,建议重点检查以下几个方向:
- 人物面部是否崩坏,五官是否错位;
- 肢体动作是否自然,手指是否变形;
- 服装材质是否合理,丝袜纹理是否自然、反光是否过度;
- 视频动态是否流畅,有没有闪烁或跳帧;
- 画面色调是否统一,是否符合“极光黑丝”的风格设定。
7.2 定量统计规则
不仅是“看图说话”,高质量的团队通常会给每条生成结果打一个分数,然后统计通过率。例如:
- 优秀(90 分以上):人物、材质、动态全部合格,可直接使用;
- 合格(70 到 90 分):有轻微瑕疵,但可通过后处理修复;
- 废片(70 分以下):存在严重崩坏,无法修复,弃用。
如果优秀的比例低于 10%,需要回到 LoRA 训练和提示词质量本身找原因;如果废片比例超过 70%,就要考虑模型参数或参考图是否存在明显问题。
7.3 用对比测试确认风格收敛
当你训练了一个新的 LoRA 时,怎么确认它真的有效?做一个简单的对比即可:用同一组提示词,在开启和关闭 LoRA 的情况下分别生成 10 张图,然后放在一起对比。
如果 LoRA 确实有效,开启后的生成结果会有明显一致的风格倾向;如果 10 张图之间依旧差异很大,说明 LoRA 训练数据不够或不均衡,需要回头补充训练集。
8. 常见问题与排查方法
| 问题现象 | 可能原因 | 排查方式 | 解决方案 |
|---|---|---|---|
| 启动即报显存不足 | 模型权重过大或分辨率设置过高 | 查看启动日志和显存监控 | 使用量化版权重,降低分辨率,开启低显存模式 |
| 视频生成结果风格杂乱 | LoRA 未生效或权重偏低 | 查看节点中 LoRA 是否启用、权重是否为 0 | 检查 LoRA 文件路径,提高 strength 到 0.7 以上 |
| 人物面部扭曲变形 | 提示词缺少约束或模型步数不足 | 检查负面提示词和采样步数 | 增加负面提示词,将采样步数提高到 25 以上 |
| 丝袜材质反光不自然 | 基础风格词不准或调度器不合适 | 对比不同调度器输出 | 切换 karras,微调光亮类关键词 |
| 批量生成中断 | 长时间运行时显存或显存温度过高 | 查看日志和硬件状态 | 降低单批任务量,增加间隔时间 |
| 提示词包导入失败 | 文件格式或编码不正确 | 检查 JSON/文本文件头和编码 | 统一使用 UTF-8 编码,用代码库处理文件 |
补充说明一下,视频生成非常消耗时间和显存,跑一个批量任务动辄几小时。如果中途断了,不要只续跑,要先保存好已完成的结果,再分段批量运行。这也是为什么建议把任务拆成小批次,而不是一次性提交 200 个任务。
9. 最佳实践与工程建议
如果你要把这套方法用在正经项目里,而不是仅仅“玩玩”,下面这些工程层面的建议会更重要。
9.1 提示词版本管理
18694 条提示词不是一次性写出来的。你会反复调整风格词、变量词、负面词、LoRA 触发词。建议用文件目录的方式管理提示词版本:
prompts/ ├── v1/ │ ├── base_style.txt │ ├── negative_prompt.txt │ ├── content_variables.json │ └── generated_prompts.json ├── v2/ │ └── ... └── README.md每次调整都要归档,否则几天后你根本记不清这版提示词是基于哪个 LoRA 调出来的。
9.2 生成任务可复现性
视频生成是带随机性的,但为了排查问题,每个任务都应该记录完整的参数:种子值、模型版本、LoRA 名称和权重、调度器、步数、CFG、分辨率、提示词。这样出了问题才能回放。
建议在生成时自动生成一份任务清单:
{ "generation_id": "task_0001", "timestamp": "2025-06-19 14:30:00", "prompt": "aurora night, black silk stockings, walking forward, close-up, aurora sky, krea2_aurora_silk", "negative_prompt": "bad anatomy, deformed hands, blurry texture", "model": "minimax_h3_33b", "lora": "krea2_aurora_silk.safetensors", "parameters": { "steps": 28, "cfg": 6.5, "sampler": "euler_ancestral", "scheduler": "karras", "resolution": "640x960" }, "seed": 20250619, "status": "passed" }9.3 数据安全与模型许可
本地部署模型时,要明确检查模型的开源协议。不同模型对商业使用的限制不同,直接拿开源模型做商业项目,遇到侵权纠纷会很麻烦。尤其是训练 LoRA 时用到的数据集,如果来自互联网,要小心版权边界。
9.4 内容合规边界
做“人物穿着类”内容的批量生成,要特别留意尺度问题。不同的内容平台对服装、姿势、镜头描述有不同的审核标准。刚才讲过,这里再强调一遍:建议把技术思路迁移到健康、合规的垂直风格领域,比如时尚、汉服、国风、民族服饰,技术逻辑完全一样,但商业空间和平台接受度会更好。
9.5 自动化程度与人工介入的平衡
这个项目的技术流程已经相当自动化,但完全无人值守的批量生成通常不可取。视频生成模型的“幻觉”特征决定了它一定会产出崩坏内容。建议分配好时间:机器负责生成候选,人负责审查筛优,人机协作是当前最实用的方式。
9.6 工作流文件的版本管理
ComfyUI 的 workflow 文件本身就是一个 JSON,建议把每个阶段的 workflow 都保存下来,标注好对应的提示词包和模型版本。这样以后无论升级模型还是复现效果,都能快速定位问题。
10. 总结与后续学习方向
这篇文章从“图图的嗨丝系列”这个具体项目切入,分析了它背后的通用技术路径:MiniMax H3 负责视频生成,KREA2 负责风格控制和调度,LoRA 把“极光黑丝”风格固化,提示词包则把风格和内容变量结构化,最终通过批量生成和筛选产出 200 段视频、186 张图片。
这套思路真正能迁移的价值是:只要你想在某个垂直风格领域稳定批量产出内容,就可以用这套组合拳去搭建自己的流程。它同样适用于国风、赛博朋克、古建筑、机械设计等更广泛的风格主题。
如果你是第一次接触这类模型和工作流,建议先从最小可行流程开始:一张参考图、一段短视频、十条提示词,跑通之后再逐步扩大到完整的批量流程。不要一上来就追求 1.8 万条提示词,因为提示词库是在迭代中慢慢长大的,而不是一次性规划出来的。
后续进阶的方向,可以继续研究:
- MiniMax H3 的 Ref2VA 模式如何更精确地控制视频内容;
- KREA2 的 LoRA 训练,如何用更少的图片训出更稳的风格;
- ComfyUI 中更复杂的视频后处理工作流;
- 如何用脚本自动批量调用本地模型接口;
- 模型融合与蒸馏技术,把多个模型的优势压缩到一个更轻量的模型里。
这套领域还处在一个快速迭代的时期,现在积累的工作流经验,很可能过几个月又会被新模型刷新。但底层的东西不会过时:对模型能力的理解、对提示词工程的组织、对批量生产的工程化思维。这些才是真正值得收藏和沉淀的部分。