☰
Stable Diffusion提示词指南:从堆词到结构化工程实践
2026/9/29 15:57:05 网站建设 项目流程

简介:《Stable Diffusion 提示词指南书》是一份面向AI绘画创作者、数字艺术爱好者及OpenArt平台用户的实用PDF手册,帮助读者系统掌握提示词(Prompt)的构建逻辑与修饰词(Modifiers)运用技巧,解决生成图像与创意预期不匹配的常见问题。资源包内含1个PDF文件,大小约15.15MB,内容按章节展开:第2节讲解提示词格式与句子结构,第3节列举形状、色彩、氛围、情感等各类修饰词用法,第4节整理有助于提升生成质量的特殊词汇,第5节则涉及分辨率、迭代次数等参数微调思路,并附有OpenArt平台数百万提示词的参考建议。目前已有3550人学习,适合从入门到进阶的创作者对照练习,逐步提升对画面风格与细节的精准控制能力。

1. 拿到这份 SD 提示词指南书,先别急着翻页

很多人第一次打开 Stable Diffusion 的 WebUI,面对那个空荡荡的提示词输入框,脑子里只有一句“a cat”。出图之后觉得也就那样,然后转头去研究模型、LoRA、ControlNet,折腾一圈回来发现,图还是不好看。问题往往不在模型,而在提示词——你给模型的指令太模糊了。这份 OpenArt 出的《Stable Diffusion 提示词指南书》PDF,就是专门解决这个问题的。它不是那种罗列几百个咒语的“魔法书”,而是从提示词的结构、权重、语法、风格控制几个层面,把“怎么跟模型说话”这件事拆开讲清楚。适合已经装好 SD、能跑通基础出图,但出图质量不稳定、想系统提升提示词控制力的从业者。如果你还在纠结安装和环境配置,这份资源暂时帮不上忙;但如果你已经能出图,只是觉得“玄学”,那它正好补上你缺的那一环。

2. 提示词的结构化拆解:从“堆词”到“写句子”

2.1 为什么你的提示词总是不生效

大部分人写提示词的习惯是想到什么写什么,比如“1girl, beautiful, detailed face, masterpiece, best quality, 8k, ultra detailed”。这种写法在早期 SD 1.5 时代还能碰运气出好图,但在 SDXL 或者经过微调的模型上,效果会大打折扣。原因在于,Stable Diffusion 的文本编码器(CLIP)对提示词的处理不是简单的关键词匹配,而是把整个提示词当作一个语义整体来编码。词与词之间的位置、顺序、权重,都会影响最终的条件向量。

这份指南书里反复强调一个观点:提示词不是“咒语列表”,而是一段“给画师的 brief”。你要告诉模型:画什么主体、什么动作、什么环境、什么风格、什么画质。这四个维度缺一个,模型就会自己“脑补”,而脑补的结果往往不可控。比如你只写“a girl”,模型不知道她是站着还是坐着、在室内还是室外、是照片还是插画,于是每次出图都像开盲盒。

书里给了一个很实用的结构模板,我把它整理成更符合工程习惯的写法:

[主体描述] + [动作/姿态] + [环境/背景] + [光照/氛围] + [风格/媒介] + [画质/细节] + [负面提示]

这个顺序不是随便排的。CLIP 编码器对提示词前 75 个 token 的注意力更集中,所以把最重要的主体和动作放在最前面,画质词和风格词往后放。很多人把“masterpiece, best quality”写在最前面,其实浪费了宝贵的注意力权重。

2.2 权重语法:括号、数字与混合写法

书里花了整整一章讲权重控制,这是提示词从“能用”到“精准”的关键。Stable Diffusion 支持几种权重语法,不同 WebUI 的解析方式略有差异,但核心逻辑一致。

最基础的是圆括号加权:

(red dress:1.3)

这表示“red dress”这个概念的权重是 1.3 倍。默认权重是 1.0,低于 1.0 是减弱,高于 1.0 是增强。注意,权重不是越高越好。超过 1.5 之后,画面容易出现色彩溢出、结构崩坏,比如衣服变成一团红色色块。书里建议单概念权重控制在 0.8~1.4 之间,超过这个范围就要考虑是不是提示词本身写得太模糊。

方括号是减权:

[red dress]

等价于(red dress:0.9)左右,但不同实现有差异。更稳妥的写法还是显式写数字。

还有一种混合写法,用于同时强调多个概念:

(red dress:1.2), (blue shoes:1.1), (silver hair:0.9)

这里有个坑:权重是乘法的,不是加法的。如果你写(red:1.5), (dress:1.5),实际效果不是“红色连衣裙权重 1.5”,而是红色和连衣裙各自被放大,可能导致颜色和材质分离。正确的做法是把它们作为一个整体:(red dress:1.4)。

书里还提到一个进阶技巧:用BREAK关键字强制截断。比如:

a girl in the forest BREAK masterpiece, best quality, 8k

BREAK会把提示词分成两段,分别编码后再拼接。这在 SD 1.5 上效果明显,但在 SDXL 上因为用了双文本编码器,行为会有些不同。我一般只在需要严格隔离风格词和内容词的时候才用,日常出图不太依赖这个。

2.3 负面提示词:不是垃圾桶,是雕刻刀

负面提示词(Negative Prompt)是很多人忽略的重灾区。常见做法是把网上抄来的一大串“lowres, bad anatomy, bad hands, text, error, missing fingers, extra digit, fewer digits, cropped, worst quality, low quality, normal quality, jpeg artifacts, signature, watermark, username, blurry”直接贴进去。这串东西在 SD 1.5 时代确实能压住一些常见瑕疵,但在新模型上,过度堆砌负面词会压制画面的多样性和细节。

书里的观点很明确:负面提示词应该针对你当前出图的具体问题来写,而不是无脑复制。比如你出的是风景图,就不需要写“bad hands”;你出的是特写人像,才需要重点压制手部和面部结构问题。

一个更工程化的做法是分层写负面词:

# 基础质量层 lowres, worst quality, low quality, jpeg artifacts, blurry # 结构层(按需) bad anatomy, extra limbs, missing fingers, fused fingers # 内容层(按需) text, watermark, signature, username # 风格层(按需) 3d, cartoon, anime(如果你要写实照片)

这样写的好处是,你可以根据出图结果快速定位是哪一层出了问题。如果手崩了,就加强结构层;如果画面太糊,就加强基础质量层。而不是面对一长串负面词,不知道哪个在起作用。

提示:负面提示词的权重语法和正面一样,但一般不建议给负面词加高权重,容易导致画面出现奇怪的“空洞”或“涂抹感”。保持默认权重,靠增减词条来控制。

3. 风格控制与模型适配:同一套词在不同模型上的表现差异

3.1 写实、插画、二次元:风格词的选择逻辑

书里把常见风格分成了几大类,每类给了对应的关键词簇。但比关键词更重要的是理解“风格词的作用机制”。Stable Diffusion 的风格控制,本质上是把提示词映射到模型潜在空间里的某个区域。你写的风格词越具体、越接近模型训练数据里的标注方式,效果就越稳定。

比如“photorealistic”和“raw photo”都能出写实图,但后者在 SD 1.5 系模型上往往更锐利、噪点更多,因为训练数据里“raw photo”对应的样本本身就有这些特征。而“cinematic lighting”会引入电影感的布光,但如果你同时写“studio lighting”,两者会打架,模型不知道该听谁的。

书里给了一个很实用的排查方法:当你发现风格词不生效时,先检查是不是被其他词压制了。比如你写了“anime style”又写了“photorealistic”,模型会困惑。这时候要么删掉一个,要么用权重明确偏向:(anime style:1.3), (photorealistic:0.7)。

另一个常见问题是风格词和模型不匹配。你在一个专门训练二次元的模型上写“raw photo”,出图会不伦不类。这不是提示词的问题,是模型本身的能力边界。书里建议:先确定模型的主攻方向,再选对应的风格词。SDXL 基础模型偏向写实和通用,二次元模型(比如 Anything 系列)对日系风格词更敏感,而 2.5D 模型则介于两者之间。

3.2 用表格对比不同模型下的提示词适配

我把书里散落在各章的模型适配要点整理成了一张表,方便对照:

模型类型推荐风格词慎用词权重敏感度
SD 1.5 通用masterpiece, best quality, detailed过度写实词(raw photo)高,权重微调即有明显变化
SDXL 基础photorealistic, cinematic, 8k过多低质量负面词中,对提示词长度更宽容
二次元专精anime, manga, cel shadingphotorealistic, raw photo高,风格词冲突明显
2.5D 混合semi-realistic, detailed face极端风格词中,适合过渡风格

这张表不是绝对的,但能帮你快速判断手里的模型适合什么写法。书里特别提醒:不要在一个模型上死磕不合适的风格,换模型比改提示词更省时间。

3.3 提示词模板的复用与微调

书里提供了几十个模板,覆盖人像、风景、产品、建筑等场景。但直接套模板往往出不了好图,因为模板里的词是针对特定模型和特定审美调的。正确的用法是:把模板当作“结构参考”,而不是“填空答案”。

我一般会这样做:先拿一个模板跑一张图,看整体构图和氛围对不对。如果大方向对了,再逐词替换。比如模板里写“a woman in a red dress standing in a garden”,我想改成“a man in a blue suit sitting in a cafe”,就只替换主体、动作、环境三个部分,风格词和画质词先不动。这样能保证风格一致性,同时快速验证新主体的出图效果。

书里还提到一个“提示词衰减”现象:当你反复用同一套提示词出图,模型会逐渐“疲劳”,出图多样性下降。解决办法是在提示词里加入随机变量,比如随机换一个光照词、随机换一个背景元素。这个技巧在批量出图时特别有用。

4. 避坑与排查:提示词不生效的五个血泪经验

4.1 现象:加了权重但画面没变化

原因:WebUI 的提示词解析器对权重的处理有上限,或者你用的语法不被当前版本支持。比如有些旧版 WebUI 不支持(word:1.3)这种写法,只认((word))这种括号叠加。另外,如果权重加在了一个模型根本不认识的词上,加多少都没用。

解决:先确认 WebUI 版本和解析器设置。在设置里找到“Prompt Editing”或“Attention”相关选项,确认权重语法开启。然后换一个模型本身认识的词测试,比如把“red dress”换成“red”,看权重是否生效。如果生效,说明是词的问题;如果不生效,说明是解析器的问题。

4.2 现象:负面提示词写了很多,但手还是崩

原因:负面提示词的作用是“抑制”,不是“修复”。如果模型在训练数据里手部样本就少,或者你出的姿势本身就让手部处于遮挡、扭曲状态,负面词压不住。另外,负面词太多会稀释每个词的权重,导致每个词都只起一点点作用。

解决:减少负面词数量,只保留最关键的 5~8 个。同时调整正面提示词,加入“perfect hands, detailed fingers”这类正向引导。如果还不行,就是模型能力问题,换一个手部训练更充分的模型,或者用 ControlNet 的手部姿态控制。

4.3 现象:换了模型后,原来的提示词完全失效

原因:不同模型的文本编码器不同,对同一个词的理解差异很大。比如 SD 1.5 和 SDXL 的 CLIP 模型不一样,SDXL 用了两个编码器,对长提示词的处理方式也不同。你在 SD 1.5 上调好的权重,直接搬到 SDXL 上可能完全不是那个效果。

解决:换模型后,先把提示词精简到核心主体和动作,跑一张图看基础效果。然后逐步加风格词和画质词,每次加一两个,观察变化。不要一次性把旧提示词全搬过去。

4.4 现象:出图总是过曝或色彩溢出

原因:权重给太高了,尤其是颜色词和光照词。比如(red:1.5), (bright:1.4)这种组合,红色和亮度都被放大,叠加起来就容易溢出。另外,某些模型的 VAE 解码器本身就有色彩偏差,和提示词无关。

解决:先把所有权重降回 1.0,看是否恢复正常。如果正常,再逐个加权重,找到导致溢出的那个词。如果是 VAE 问题,换一个 VAE 或者调整 VAE 的缩放参数。

4.5 现象:提示词里写了“detailed face”,但脸还是糊

原因:“detailed face”是一个很泛的词,模型不知道你要多详细。而且如果主体在画面中占比很小,模型分配给脸部的像素本来就少,再详细的提示词也救不回来。

解决:把“detailed face”换成更具体的描述,比如“sharp eyes, defined jawline, smooth skin texture”。同时调整构图,让脸部在画面中占更大比例。如果还不行,用高分辨率修复(Hires. fix)或者 ADetailer 插件单独处理脸部。

注意:以上五个坑,我几乎每个都踩过。最惨的一次是调了半小时权重,最后发现是 WebUI 的解析器设置被重置了。所以每次出图前,先确认基础设置,再调提示词。

5. 从指南书到工作流:把提示词管理变成可复用的工程习惯

书翻到最后一章,你会发现它其实在引导你建立一套自己的提示词管理系统。因为 SD 出图不是一次性的,而是迭代的。你今天调好的一套词,下周可能就忘了当时为什么这么写。所以,把提示词当作代码来管理,是迟早要走的一步。

我自己的做法是:在本地建一个prompts目录,按场景分文件夹,每个提示词存成一个.txt文件,文件名带上模型名和日期。比如portrait_sdxl_20250112.txt。文件内容分三段:正面提示词、负面提示词、参数备注(采样器、步数、CFG、种子)。这样下次要复现或者微调,直接打开文件就能看到全部上下文。

书里还提到一个技巧:用prompt matrix做批量测试。比如你想测试不同光照词对同一主体的影响,可以写一个矩阵脚本,把光照词作为变量,批量出图后对比。这个在 WebUI 里可以用 X/Y/Z plot 脚本实现,不需要额外写代码。

# 示例:用 Python 生成批量提示词组合 import itertools subjects = ["a woman", "a man"] lightings = ["soft light", "hard light", "rim light"] styles = ["photorealistic", "cinematic"] for subj, light, style in itertools.product(subjects, lightings, styles): prompt = f"{subj}, {light}, {style}, masterpiece, best quality" print(prompt)

这段代码的逻辑很简单:用itertools.product做笛卡尔积,生成所有组合。参数说明:subjects是主体列表,lightings是光照列表,styles是风格列表。你可以把生成的提示词批量导入 WebUI 的提示词矩阵,或者用 API 批量调用。这样一轮下来,你就能清楚知道哪个光照词配哪个风格最出效果,而不是靠感觉猜。

最后一个习惯:每次出图后,把效果好的提示词和对应的种子、模型、参数一起存档。效果差的也别删,标注一下问题(比如“手崩”“过曝”),下次遇到类似问题可以快速排除。这个习惯坚持一个月,你就有自己的提示词库了,比任何指南书都管用。

从那以后我每次开新项目,都强制先跑一轮提示词矩阵,把风格和光照定下来,再进入细节调整。希望帮到你。

本文还有配套的精品资源,点击获取

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询