如果你在B站、YouTube等技术社区关注过AI绘画,大概率刷到过“Kris的筛种教程”这个系列。这个系列视频在AI绘画爱好者中有着相当高的口碑,但视频教程的形式,对于需要反复查阅、对照操作的开发者来说,并不那么友好。尤其是当你想精准地复现某个效果,或者想理解“种子”这个核心参数背后的逻辑时,文字教程的优势就凸显出来了。
本文正是为了解决这个问题。我将基于“Kris的筛种教程”系列视频(特别是第1章:上手介绍)的核心内容,为你整理、转译并深度解读成一篇结构清晰、可操作性强、适合收藏备用的CSDN技术博客。我们不止步于“怎么用”,更要深入“为什么”,帮你彻底理解Stable Diffusion中“种子”的运作机制,掌握通过筛选种子来精准控制画面构图、主体、风格的核心方法。
读完本文,你将能:
- 透彻理解种子:明白种子在AI生图流程中的决定性作用,以及它与提示词、采样器等其他参数的关系。
- 掌握高效筛种流程:学会一套系统性的方法,从海量随机结果中,快速筛选出符合你构图和创意需求的“优质种子”。
- 搭建可复现的工作流:将筛种融入你的标准创作流程,让AI绘画从“开盲盒”变成“可控的创作工具”。
- 规避常见误区:了解筛种过程中的典型陷阱,比如过度依赖、效率低下等问题,并知道如何解决。
1. 这篇文章真正要解决的问题:从“随机抽卡”到“定向创作”
很多Stable Diffusion新手会陷入一个困境:他们精心撰写了提示词,调整了各种参数,但生成的结果却像开盲盒,时好时坏,无法稳定产出符合预期的作品。问题的核心往往不在于提示词写得不够好,而在于忽略了一个最基础、也最强大的控制参数——种子。
种子是AI绘画确定性的源头。同一个模型、同样的提示词和参数下,相同的种子必然产生相同的图片。这听起来简单,但它的价值被严重低估了。大多数人只是固定种子来微调,或者随机种子碰运气。
Kris教程的核心价值在于,它提出并实践了一套“主动筛选种子”的方法论。这套方法把种子的使用从“被动固定”变成了“主动勘探”。你不是在等待一个好结果出现后去固定它,而是主动地、批量化地生成大量图片,然后像淘金一样,从中筛选出那些在构图、主体姿态、画面布局等“骨架”层面就非常出色的种子。
这解决了什么痛点?
- 构图不可控:提示词很难精确控制人物姿势、物体位置、画面层次。
- 效率低下:靠随机生成碰运气,产出优质图的概率低,时间成本高。
- 创意无法延续:找到一个好图后,想在其基础上做变化(换风格、换细节)却无法保持原有构图。
- 协作与复现困难:无法向他人精确传递一个可复现的创作起点。
本文将带你深入这套方法论,不仅还原Kris教程的精华,更结合实践,补充视频中可能未详述的WebUI操作细节、脚本使用技巧和效率工具,让你能在CSDN以文字形式,永久收藏这份“筛种秘籍”。
2. 基础概念与核心原理:种子、潜空间与确定性
在进入实操前,我们必须夯实理论基础。理解这些概念,能让你在筛种时更有目的性,遇到问题也能更快定位。
2.1 什么是种子?
在计算机图形学和机器学习中,种子是一个用于初始化伪随机数生成器的数值。在Stable Diffusion的上下文中:
- 它是一个数字(通常是一个很大的整数,如
1234567890)。 - 它是生成过程的起点:在采样开始时,模型需要一个初始的随机噪声图。种子决定了这张噪声图的具体样子。
- 它意味着确定性:
模型 + 提示词 + 参数 + 种子这个组合是唯一的。只要这个组合不变,无论你生成多少次,输出都完全一样。
一个常见的误解是:种子决定了图片的“好坏”或“内容”。不对。种子决定的是初始的随机状态。图片的“内容”主要由提示词、模型和采样过程决定。但好的初始状态(即好的种子),能让采样过程更顺利地走向一个构图优美、主体清晰的“好结果”。
2.2 潜空间与去噪过程
Stable Diffusion不是在像素空间直接作画,而是在一个叫做“潜空间”的高维压缩空间中工作。
- 编码:输入图像被编码到潜空间(变成一组潜变量)。
- 加噪:向潜变量添加噪声。
- 去噪:U-Net模型根据提示词,一步步预测并去除噪声,最终得到去噪后的潜变量。
- 解码:将去噪后的潜变量解码回像素空间,得到最终图像。
种子在这里的作用是什么?它决定了第2步“加噪”后,那张纯随机噪声图的样子。你可以把去噪过程想象成从一团混沌的云雾(噪声)中雕刻出一座雕像。种子决定了这团云雾最初的具体形状。虽然雕刻刀(提示词和模型)决定了最终雕像是什么(比如一个人像),但云雾最初的形状,会极大地影响雕刻的难易程度和最终雕像的姿态、构图。
2.3 种子 vs. 提示词 vs. 采样器
理解这三者的关系至关重要:
| 要素 | 角色 | 控制范围 | 类比 |
|---|---|---|---|
| 提示词 | 内容导演 | “画什么”。定义主体、风格、细节、氛围。 | 剧本和艺术指导。 |
| 模型 | 执行演员与画风 | “用什么风格和能力画”。决定画风、细节表现力、知识库。 | 演员的演技和擅长的戏路。 |
| 种子 | 初始状态 | “从哪个随机点开始画”。影响构图、主体姿态、布局等宏观结构。 | 拍摄第一条镜头时演员的初始站位和情绪。 |
| 采样器 | 创作步骤 | “如何一步步画出来”。影响图像质量、收敛速度、细节处理。 | 导演的拍摄方法和剪辑节奏。 |
核心洞见:提示词和模型决定了内容的“可能性空间”,而种子则在这个空间里选取了一个具体的“起点”。筛种,就是在庞大的可能性空间中,寻找那些起点最优的路径。
3. 环境准备与前置条件
在开始筛种之前,你需要一个可以运行的Stable Diffusion WebUI环境。本文以Automatic1111 WebUI为例,因为它是目前最流行、功能最全的版本,Kris的教程也基于此。
基础环境要求:
- 操作系统:Windows 10/11, Linux, 或 macOS (Apple Silicon 或 Intel)。
- Python:3.10.x 版本。这是WebUI的稳定要求,其他版本可能导致依赖冲突。
- Git:用于克隆WebUI仓库。
- 合适的硬件:
- GPU:推荐NVIDIA GPU,显存至少6GB(用于生成512x512图片)。4GB显存可尝试但限制较多。8GB或以上体验更佳。
- 内存:16GB RAM 或以上。
- 磁盘空间:至少20GB可用空间,用于存放模型、生成图片等。
WebUI安装与启动(简述):如果你已经安装,可以跳过此部分。
- 打开命令行(终端)。
- 克隆仓库并进入目录:
git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui.git cd stable-diffusion-webui - 运行启动脚本:
- Windows:双击
webui-user.bat。 - Linux/macOS:在终端执行
./webui.sh。
- Windows:双击
- 脚本会自动安装依赖。首次运行时间较长。完成后,在浏览器中打开
http://127.0.0.1:7860即可访问WebUI界面。
关键模型准备:筛种的效果与模型强相关。建议准备一个你熟悉且效果稳定的基础模型。
- 检查点模型:下载一个通用的高质量模型,例如
SDXL 1.0、Realistic Vision、DreamShaper等,并将其放入stable-diffusion-webui/models/Stable-diffusion/目录。 - VAE:有些模型需要搭配特定的VAE文件以获得最佳色彩。通常模型发布页会说明。
确保你的WebUI能正常生成图片后,我们就可以进入核心的筛种流程了。
4. 核心流程拆解:四步高效筛种法
Kris的筛种方法论可以提炼为一个清晰的四步循环。这个流程的目标不是“生成一张好图”,而是“找到一个好种子”。
4.1 第一步:设定“勘探”提示词
筛种阶段的提示词与最终成图的提示词策略不同。
- 目标:引导模型生成构图多样、主体清晰的图片,而非追求完美的细节和风格。
- 策略:
- 简洁核心:只用最核心的主体和场景描述。例如:
1girl, solo, standing in a forest, sunlight。避免复杂的细节描述、风格词和画质词(如masterpiece, best quality在筛种时可能限制构图多样性)。 - 强调构图元素:可以加入一些引导构图的词,如
full body shot,from side,dynamic pose,rule of thirds。 - 负面提示词:使用一个通用的负面提示词来过滤明显瑕疵,例如:
EasyNegative, bad hands, extra fingers。但不宜过强,以免过度干预初始构图。
- 简洁核心:只用最核心的主体和场景描述。例如:
示例勘探提示词:
正向提示词:1girl, cowboy shot, wearing jacket, in city street at night, neon lights 反向提示词:EasyNegative, bad anatomy, blurry4.2 第二步:配置批量生成参数
这是筛种的“生产流水线”。我们需要一次生成大量图片(比如50-200张),以覆盖足够多的随机种子。
- 采样方法:选择速度快、效果稳定的采样器,如
Euler a、DPM++ 2M Karras。筛种不求极致细节,求速度。 - 采样步数:20-30步通常足够。这能在保证一定质量的同时最大化生成速度。
- 图片尺寸:根据你的最终目标设定。如果想筛竖构图人像,可以用
512x768。注意长宽比会显著影响构图。 - 批处理次数/数量:
批处理数量:每次生成几张图。受显存限制。批处理大小:同时处理几张图。显存大可以调高以加速。- 例如,想生成100张图,显存8G,可以设置
批处理数量=10,批处理大小=1,点击一次生成10张,点10次。 - 更高效的方法:使用“脚本”功能。在WebUI下方找到“脚本”下拉菜单,选择
X/Y/Z 图表。
4.3 第三步:使用X/Y/Z图表脚本进行网格化筛选
这是Kris教程中的精髓工具,能极大提升筛选效率。
- 在WebUI底部,展开“脚本”下拉框,选择
X/Y/Z 图表。 - X轴类型:选择
种子。 - X轴值:这里就是关键。不要手动输入几百个种子。输入
1-100,表示让脚本自动使用种子1到100依次生成图片。你也可以输入1, 10, 100, 1000这样的列表。 - Y轴类型:保持
无。我们这次只沿X轴(种子)变化。 - 点击“生成”。WebUI会按顺序生成种子为1,2,3,...,100的图片,并将它们排列在一张大网格图中。
为什么用网格图?
- 一目了然:你可以快速浏览上百张图的构图、姿态、氛围。
- 便于对比:相似的构图会挨在一起,让你更容易发现规律。
- 种子可追溯:每张图下方或文件名中都会包含其种子值。
4.4 第四步:分析与记录优质种子
面对生成的网格图,你需要一双“淘金者”的眼睛。
- 筛选标准:
- 构图:主体位置是否舒服?画面是否有层次感?是否符合三分法等构图法则?
- 姿态/动作:是否自然、有动态感?是否是你想要的?
- 主体完整性:有没有缺胳膊少腿、严重畸变?
- 氛围感觉:即使细节粗糙,整体光影、氛围是否对味?
- 记录方法:
- 直接保存:将整个网格图保存下来,在上面做标记。
- 记录种子号:将看中的图片对应的种子号记录在文本文件或表格中。这是最重要的信息!
- 使用图库浏览器:WebUI有内置的图库浏览器,可以按种子搜索和筛选,非常方便。
完成一轮筛选后,你得到的不再是几张孤立的“好图”,而是一个优质种子库。接下来,你就可以用这些种子进行深度创作了。
5. 完整示例与代码实现:一次完整的城市夜景人像筛种
让我们通过一个完整的例子,将上述流程跑一遍。假设我们想创作一个“夜晚霓虹灯下的街头潮酷女孩”主题作品。
5.1 环境与参数预设
- 模型:
dreamshaper_8.safetensors(一个通用性较好的模型) - VAE:
vae-ft-mse-840000-ema-pruned.ckpt - 采样器:
Euler a - 采样步数:25
- 图片尺寸:
512x768(竖版,适合人像)
5.2 编写勘探提示词
在WebUI的提示词框中输入:
正向提示词:
(1girl:1.2), solo, looking at viewer, wearing leather jacket, street fashion, in a rainy neon-lit city at night, reflections on wet pavement, cinematic lighting(1girl:1.2):强调主体是女孩,并提高权重。solo, looking at viewer:单人,看向观众,增加互动感。wearing leather jacket, street fashion:描述服装和风格。in a rainy neon-lit city at night, reflections on wet pavement:核心场景,包含“雨夜、霓虹、湿漉漉的路面”等易出氛围的元素。cinematic lighting:引导光影氛围。
反向提示词:
EasyNegative, (bad anatomy:1.2), (bad hands:1.3), (worst quality, low quality:1.4), blurry, extra limbs, missing limbs, deformed, mutated- 使用
EasyNegative嵌入(需提前下载放入embeddings文件夹)。 - 强化对解剖错误和手部问题的抑制。
5.3 配置X/Y/Z图表脚本进行批量筛种
- 填写好提示词和基础参数(采样器Euler a,步数25,尺寸512x768)。
- 滚动到下方,找到“脚本”下拉菜单,选择
X/Y/Z 图表。 - 按如下配置:
- X轴类型:
种子 - X轴值:
1-60(我们首轮先快速跑60个种子看看趋势) - Y轴类型:
无 - 保持其他参数一致:确保脚本使用的是上面填写的提示词和参数。
- X轴类型:
- 点击“生成”按钮。
WebUI会开始依次生成60张图。这个过程可能需要几分钟,取决于你的硬件。
5.4 生成结果分析与种子记录
生成完成后,你会得到一张排列好的网格图。假设我们观察后发现:
- 种子
7,18,34的人物姿态非常自然,构图有张力。 - 种子
42的霓虹灯光影氛围特别好。 - 种子
55的雨天地面反射效果很出色。
我们将这些种子记录下来:[7, 18, 34, 42, 55]。
5.5 基于优质种子进行深化创作
现在,我们不再随机抽卡。我们选择一个最有潜力的种子(比如种子18)进行深化。
- 固定种子:在WebUI的“种子”输入框中,输入
18,并点击旁边的“回收站”图标按钮锁定它。 - 优化提示词:在勘探提示词的基础上,添加细节和风格化词汇。
- 更新正向提示词:
(masterpiece, best quality:1.2), (1girl:1.3), solo, looking at viewer, (detailed face:1.1), wearing a black leather jacket, street fashion, in a rainy neon-lit (Tokyo:1.1) at night, reflections on wet pavement, (cinematic lighting, dramatic shadows:1.2), film grain, 8k uhd- 增加了画质标签
masterpiece, best quality。 - 增加了
detailed face强调面部。 - 具体化了城市为
Tokyo。 - 加强了光影描述
dramatic shadows。 - 添加了后期风格
film grain和分辨率提示8k uhd。
- 增加了画质标签
- 更新正向提示词:
- 调整参数:
- 采样器:可以换成更擅长细节的
DPM++ 2M Karras或DDIM。 - 采样步数:提高到
30-40步以获得更精细的结果。 - 高清修复:可以开启,使用
R-ESRGAN 4x+等放大算法,将图片放大2倍。
- 采样器:可以换成更擅长细节的
- 点击生成。由于种子固定,这次生成会在保留种子18优秀构图和姿态的基础上,融入新的细节和画质提升。
对比感受:你可以尝试关掉固定种子,用同样的优化提示词随机生成几张图。你会发现,虽然画质可能都不错,但构图和姿态的“美感”和“巧合性”远不如使用筛选出的种子18。这就是筛种的价值——它锁定了“灵感闪现的瞬间”。
6. 运行结果与效果验证
如何判断你的筛种流程是成功的?
- 网格图成功生成:运行X/Y/Z图表脚本后,应得到一张整齐排列所有生成图片的网格图。每张小图下方应显示对应的种子号。如果报错,检查脚本参数格式(种子范围
1-60是否正确),或显存是否不足。 - 种子差异性:观察网格图,不同种子产生的图片应在构图、人物姿态、视角上有明显差异。如果所有图片看起来都差不多,可能是提示词限制过强(比如用了
portrait特写),或者模型本身多样性不足。此时应放宽勘探提示词。 - 优质种子可复现:记录下你选中的种子号(例如18)。回到文生图主界面,输入完全相同的提示词和参数,并将种子设为18,点击生成。生成的图片必须与网格图中种子18对应的图片完全一致。这是验证流程正确性的金标准。
- 深化效果符合预期:使用固定种子并优化提示词后,新生成的图片应在保持原构图骨架的同时,在细节、画质、风格上得到显著提升。你可以将优化前后的两张图放在一起对比,核心姿态和场景布局应该是一致的。
7. 常见问题与排查思路
在筛种过程中,你可能会遇到以下问题:
| 问题现象 | 可能原因 | 排查方式 | 解决方案 |
|---|---|---|---|
| 生成的所有图片构图都非常相似 | 1. 勘探提示词限制过强(如指定了close-up,portrait)。2. 使用的模型本身风格/构图单一。 3. CFG Scale值过高,导致提示词约束过强。 | 1. 检查并简化正向提示词,移除强构图限制词。 2. 换一个不同风格的模型测试。 3. 尝试降低CFG Scale(如从7降到5)。 | 回归简洁的勘探提示词,确保模型多样,适当调整CFG Scale。 |
| X/Y/Z图表脚本报错或只生成一张图 | 1. 脚本参数填写格式错误。 2. “批处理数量”被设置为1。 3. 显存不足,无法进行批量生成。 | 1. 检查“X轴值”格式是否正确(如1-60)。2. 确认文生图区域的“批处理数量”是否大于1。 3. 查看命令行或WebUI控制台的错误信息。 | 1. 正确填写脚本参数。 2. 在脚本中,文生图的“批处理数量”应设为1,由脚本控制总数。 3. 减少单次生成数量,或使用 --medvram等优化参数启动WebUI。 |
| 选中种子深化后,图片完全变了 | 1. 深化时更改了图片尺寸。 2. 深化时更改了模型。 3. 深化时使用了不同的VAE。 4. 提示词权重结构发生剧烈变化。 | 1. 对比两次生成的所有参数。 2. 检查模型、VAE文件名是否一致。 | 固定种子时,必须同时固定模型、VAE和图片尺寸。提示词可以优化,但避免彻底改变主体和场景描述。 |
| 筛选出的种子,换一个类似提示词就不好看了 | 种子的“好”与当前提示词、模型强绑定。它代表的是特定组合下的最优起点。 | 理解种子的局限性。它不是一个“万能好种子”。 | 对于新的主题或风格,建议重新进行筛种流程。可以将旧种子作为参考,但不要期望完全复用。 |
| 筛种效率太低,看花眼了 | 一次性筛选太多(如500张),导致视觉疲劳,无法聚焦。 | 分批次、有目的地筛选。 | 1. 每轮筛种数量控制在50-150张。 2. 先快速扫视,标记“可能不错”的,第二轮再仔细对比。 3. 明确本轮筛选的重点(如“专注筛选坐姿”)。 |
8. 最佳实践与工程建议
将筛种从一个技巧升级为一种稳定的工作流,需要一些工程化的思维。
8.1 建立个人种子库
不要每次创作都从零开始筛种。建立一个分类管理的种子库。
- 工具:一个简单的Excel/Google Sheets表格,或笔记软件(如Notion、Obsidian)。
- 记录字段:
- 种子号
- 对应的模型名称
- 对应的基础提示词(勘探词)
- 图片尺寸
- 简短描述(如“侧身站姿,街头风”,“坐姿,窗户光影”)
- 效果评分(1-5星)
- 生成图片的缩略图或文件名
- 定期整理:将每次筛种得到的优质种子归档进来。久而久之,你就拥有了一个针对不同场景、不同模型的“优质构图起点库”。
8.2 分层筛种与主题化勘探
不要漫无目的地筛。
- 第一层:通用构图筛种。使用非常简洁的提示词(如
1person, indoors),旨在获取大量基础人体姿态和室内布局的种子。这批种子作为“万能素材”。 - 第二层:主题强化筛种。在已有不错构图的种子基础上,固定种子,然后微调提示词向特定主题靠拢(如将
indoors改为cyberpunk bar),观察主题融合效果,筛选出最适合该主题的种子子集。 - 第三层:风格化筛种。固定前两层筛选出的种子和主题提示词,通过切换不同风格的模型或添加风格LoRA,筛选出最能体现目标风格的最终种子。
8.3 与其它控制手段结合
种子是控制链的起点,但不是终点。学会将其与其他工具结合:
- ControlNet:筛种得到优秀但略有瑕疵的姿势后,用OpenPose提取其骨骼图,再用ControlNet进行精准的姿态控制和新一轮生成。
- Img2Img:将筛种得到的图片,通过Img2Img配合较低的
去噪强度进行重绘,可以在保持构图的同时修复细节、改变风格。 - 区域提示:对于筛种图中局部不满意的地方(如背景),可以使用区域提示功能进行局部重绘,而不影响整体构图。
8.4 性能与效率优化
- 使用低分辨率筛种:筛种阶段可以使用
384x512等更小的分辨率,大幅提升生成速度。确定种子后,再用高清修复放大。 - 利用中断功能:在X/Y/Z图表生成过程中,如果看到前几十张已经出现足够多的优质候选,可以直接中断生成,节省时间。
- 脚本进阶使用:探索其他脚本,如
提示词矩阵可以与筛种结合,一次性测试同一种子下不同提示词的效果。
9. 总结与后续学习方向
通过本文对“Kris筛种教程”核心方法的拆解与拓展,你应该已经深刻认识到,种子不仅仅是图片的“身份证号”,更是AI绘画创作中控制构图与灵感的“导航仪”。主动筛种,是将创作主动权从“随机性”手中夺回的关键一步。
本文的核心收获可以总结为三点:
- 思维转变:从“抽到好图后固定种子”变为“为了找到好种子而批量生成”。
- 流程固化:掌握了“简洁勘探词 -> X/Y/Z图表批量生成 -> 网格化视觉筛选 -> 记录优质种子 -> 固定种子深化”这一高效工作流。
- 理解深化:明白了种子与提示词、模型等其他参数的协同关系,知道了种子的能力边界。
接下来你可以探索的方向:
- 深入ControlNet:学习如何使用Canny、Depth、OpenPose等ControlNet模型,对筛种得到的构图进行更精细、更强大的控制。
- 研究模型特性:不同模型对同一提示词和种子的响应差异巨大。尝试为你常用的模型建立专属的“优质种子库”。
- 探索动态提示词:在批量筛种时,使用动态语法(如
__pose__)来自动替换关键词,一次性勘探更多变量组合。 - 自动化工具:了解一些SD插件或外部工具,它们可以帮助你更智能地管理、筛选和评分海量生成结果。
筛种是AI绘画从“玩一玩”到“搞创作”的分水岭。它需要一些前期的耐心和练习,但一旦掌握,你将能稳定地输出符合自己审美和构思的作品。建议你将此页收藏,并在下次开始一个新的AI绘画项目时,刻意地实践一遍这个流程。很快,它就会成为你肌肉记忆的一部分。