1. 从“咒语”到“工程”:理解提示词的本质
如果你刚开始接触 Stable Diffusion,可能会觉得写提示词就像在念咒语——把一堆英文单词扔进去,然后祈祷 AI 能理解你的意思,生成一张像样的图。我刚开始也是这么想的,结果往往是“买家秀”和“卖家秀”的巨大落差。后来我花了大量时间测试、记录、分析,才慢慢明白,提示词(Prompt)远不是简单的关键词堆砌,它更像是一门与 AI 进行精确沟通的“工程学”。
提示词是连接你的想象力和 AI 生成能力的唯一桥梁。AI 模型,比如 Stable Diffusion,本质上是一个经过海量图文数据训练的复杂数学函数。你输入的提示词,会被模型内部的文本编码器(如 CLIP)转换成一串高维度的数字向量,这个向量决定了模型在“潜空间”中探索的方向。简单来说,你的提示词就是给 AI 的“导航指令”,指令越清晰、越具体,AI 就越能准确地抵达你脑海中的目的地。
很多人抱怨 AI 画得不好,问题往往就出在这个“导航指令”上。模糊的指令如“一个美女”,会导致 AI 在无数种“美女”的可能性中随机游走,结果自然不稳定。而一个结构清晰、要素完备的提示词,则能极大地约束和引导生成过程,让结果变得可控、可预期。因此,掌握提示词技巧,核心在于学会如何将你脑中模糊的“感觉”,拆解成 AI 能够精确执行的“结构化描述”。这不仅仅是艺术创作,更是一种逻辑构建。
2. 构建提示词的黄金结构:从骨架到血肉
经过无数次测试和对比,我发现一个高效、稳定的提示词通常遵循一个内在的结构。你可以把它想象成写一篇文章:先确定主题和主体,再描绘环境氛围,最后用细节和风格定调。下面这个结构是我个人实践下来最有效的框架,它能让你的提示词从“杂乱的关键词列表”升级为“可执行的生成蓝图”。
2.1 核心主体:你想画什么?
这是提示词的灵魂,必须放在最前面,并且描述要尽可能具体。避免使用宽泛的名词。
- 基础描述:从最基本的开始。
1girl(一个女孩)就比girl好。如果你想画一个男孩,就是1boy。 - 外貌特征:这是让角色具有辨识度的关键。不要只说“漂亮”,要具体化。
- 发型发色:
long silver hair(银色长发)、twin tails(双马尾)、messy black hair(凌乱的黑发)。 - 瞳色:
blue eyes(蓝眼睛)、heterochromia(异色瞳)。 - 面部特征:
sharp eyes(锐利的眼睛)、small nose(小鼻子)、freckles(雀斑)。 - 身材与体型:
slim body(苗条身材)、athletic build(运动体型)、petite(娇小)。
- 发型发色:
- 服饰与姿态:直接定义角色的状态和动作。
- 衣着:
wearing a white dress(穿着白色连衣裙)、in a business suit(穿着商务西装)、armor(盔甲)。 - 姿态:
standing(站立)、sitting on a chair(坐在椅子上)、looking at viewer(看向观众)、dynamic pose(动态姿势)。像热词中的“趴姿”,就可以用lying on stomach(趴着)或prone position来描述。
- 衣着:
注意:在描述人物时,应注重艺术性和美感,避免使用可能引导生成不当内容的词汇。我们的创作应积极、健康,符合主流审美。
示例对比:
- 模糊指令:
a beautiful girl(一个美丽的女孩) - 结构化指令:
1girl, long wavy blonde hair, green eyes, wearing a red sweater, smiling softly, looking at viewer(一个女孩,长长的波浪金发,绿眼睛,穿着红色毛衣,温柔地微笑,看着观众)
后者能生成出风格、样貌高度统一的图像,而前者则像开盲盒。
2.2 环境与背景:故事发生在哪里?
主体确定后,就需要为其搭建舞台。背景描述能极大地提升画面的故事感和完整性。
- 场景类型:
in a classroom(在教室里)、on a spaceship bridge(在飞船舰桥上)、at a bustling medieval market(在熙熙攘攘的中世纪市场)。 - 自然环境:
cherry blossom garden(樱花花园)、snowy mountain peak(雪山峰顶)、underwater coral reef(水下珊瑚礁)。 - 时间与光影:
sunset(日落)、golden hour(黄金时刻)、moonlight(月光)、neon lights(霓虹灯光)、cinematic lighting(电影感灯光)。 - 氛围渲染:
mysterious atmosphere(神秘氛围)、peaceful and quiet(宁静)、epic scale(史诗感)。
环境描述不仅填充画面,还能与主体产生互动,影响整体的色调和情绪。
2.3 画面风格与质量:决定成片的“滤镜”和“分辨率”
这是将一张“不错的图”变成“惊艳的图”的关键。这部分词汇通常对画面有全局性的影响。
- 艺术风格:这是最强大的“滤镜”。
digital painting(数字绘画)anime(动漫风格)oil painting(油画风格)photorealistic(照片写实)3D render(3D 渲染)—— 对应热词中的“3d写实风格”cyberpunk(赛博朋克)impressionism(印象派)
- 画质与细节增强:这些是“分辨率”和“细节”的保证。
masterpiece(杰作)best quality(最佳质量)ultra detailed(超精细)intricate details(复杂细节)sharp focus(锐利对焦)
- 镜头与构图:模仿摄影和电影语言。
close-up(特写)full body shot(全身照)low angle view(低角度)rule of thirds(三分法构图)
2.4 权重控制与语法:让AI听懂重点
当你把所有元素组合在一起时,需要一种方法来告诉 AI 哪些更重要。这就是权重控制和基础语法。
- 括号加权
():这是最常用的方法。(word)表示增加该词汇的权重,可多层嵌套,((word))权重更高,通常每对括号增加约 1.1 倍权重。例如,(red dress:1.3)和((red dress))效果类似,都强调红色连衣裙。 - 数字权重
::更精确的控制。语法是(word:weight),weight是数字。(sunset:1.5)表示“日落”的权重是 1.5 倍。权重小于 1 则表示减弱,如(tree:0.7)。 - 交替词
[A|B]:让 AI 在 A 和 B 之间随机选择,用于增加多样性。例如[red|blue] dress会随机生成红色或蓝色的裙子。 - 融合词
AND:用于连接两个概念,让它们同时影响图像。这在组合不同角色或复杂概念时有用,但需要更高级的控制网络(如 Composable Diffusion)来完美实现,在基础文生图中效果有限。
一个综合了上述所有技巧的完整提示词示例:
(masterpiece, best quality, ultra detailed), 1girl, (long flowing silver hair:1.2), glowing blue eyes, wearing an intricate white and gold armor, standing on a cliff, (fantasy castle in the distance), dramatic sunset sky, (cinematic lighting:1.3), epic fantasy art, digital painting, by Greg Rutkowski and Artgerm(杰作,最佳质量,超精细,1个女孩,飘逸的银色长发(权重1.2),发光的蓝眼睛,穿着精致的白金盔甲,站在悬崖上,远处的奇幻城堡,戏剧性的日落天空,电影感灯光(权重1.3),史诗奇幻艺术,数字绘画,作者 Greg Rutkowski 和 Artgerm)
3. 进阶技巧:负面提示词与模型特性
掌握了基本结构,你已经能生成不错的图了。但要解决那些“奇怪的手”、“多余的手指”、“扭曲的脸”或者不想要的画风元素,就需要用到负面提示词(Negative Prompt),并理解你所用模型的“性格”。
3.1 负面提示词的魔法:告诉AI“不要什么”
负面提示词是一个独立的输入框,用于列出你希望图像中绝对不要出现的东西。这是提升出图成功率最有效的工具之一。
一个通用的高质量负面提示词模板,适用于大多数写实或动漫风格模型:
(worst quality, low quality:1.4), (bad anatomy), (inaccurate limb:1.2), bad hands, missing fingers, extra digit, fewer digits, (bad feet:1.2), (poorly drawn face), (mutation:1.3), (disfigured:1.2), ugly, blurry, (bad proportions:1.1), (extra limbs:1.3), cloned face, (disfigured:1.3), gross proportions, (malformed limbs:1.2), (missing arms:1.3), (missing legs:1.3), (extra arms:1.3), (extra legs:1.3), (fused fingers:1.3), (too many fingers:1.3), (unclear eyes:1.2), (bad hands:1.3), (bad feet:1.3), text, error, signature, watermark, username, artist name, (foreign characters:1.1)(最差质量,低质量,解剖结构错误,不准确的肢体,坏手,缺少手指,多余的手指,手指过少,坏脚,画得差的脸,突变,畸形,丑陋,模糊,比例差,多余的肢体,克隆脸,畸形,奇怪的比例,畸形的肢体,缺少手臂,缺少腿,多余的手臂,多余的腿,融合的手指,手指过多,不清晰的眼睛,坏手,坏脚,文字,错误,签名,水印,用户名,艺术家名,外文字符)
如何使用:
- 直接套用:对于新手,可以直接将上面这段模板复制到你的负面提示词框中,它能过滤掉约80%的常见低级错误。
- 针对性添加:根据你的正面提示词添加特定负面词。例如,画现代人物时,可以加上
medieval armor, sword(中世纪盔甲,剑)来防止出现不相关的元素。画静物时,可以加上person, human(人,人类)。 - 权重控制:负面词同样支持权重。
(ugly:1.5)会比ugly更强烈地抑制“丑陋”的特征。
3.2 理解你的模型:它擅长什么,偏好什么?
不同的 Stable Diffusion 模型(如 ChilloutMix, Anything, Counterfeit)是在不同类型的数据集上训练的,因此它们有各自的“舒适区”和“语法偏好”。
- 动漫模型(如 Anything V5):通常对
masterpiece, best quality等质量词反应强烈,角色描述可以更简洁,风格词如anime screencap(动画截图)效果很好。 - 写实模型(如 Realistic Vision):更需要详细的场景、光影和材质描述。
photorealistic, 8k是关键。人物描述需要更符合真实人体比例。 - 特定风格模型(如 Inkpunk Diffusion):本身已经内置了强烈风格,你的提示词应该更侧重于内容描述,风格词可以弱化。
- 检查点触发词:很多模型有自己偏好的“触发词”,这些词在训练时被高频使用,能更好地激活模型的特性。例如,某些模型用
chibi(Q版)风格更好,有些则需要by [艺术家名]。这需要查阅该模型的发布页面或社区笔记。
实操心得:不要用一个提示词模板通吃所有模型。生成几张图后,观察模型的“输出习惯”,然后微调你的提示词。比如,某个模型总是把皮肤画得过亮,你可以在负面词里加入overexposed(过曝);另一个模型画的眼睛总是太大,可以加入(huge eyes:1.2)到负面词中。
4. 从提示词到工作流:参数协同与迭代优化
提示词不是孤立的,它需要与 Stable Diffusion 的其他生成参数协同工作,才能发挥最大效力。同时,生成图像很少能一蹴而就,它是一个“写提示词 -> 生成 -> 分析问题 -> 修改提示词”的迭代过程。
4.1 关键生成参数与提示词的联动
- 采样步数(Steps):步数越多,AI 有更多时间“思考”你的提示词,细节会更丰富,但对提示词的执行也会更“较真”。步数少(20-30)时,风格、氛围词影响更大;步数多(50+)时,具体的物体、形状描述会更精确。对于复杂提示词,建议步数不低于30。
- 提示词相关性(CFG Scale):这个参数控制 AI 在多大程度上听从你的提示词。值太低(<7),图像自由发散,可能忽略你的指令;值太高(>12),图像会变得对比度过强、色彩饱和、生硬不自然。通常设置在 7-11 之间是甜点区。当你觉得提示词效果不强时,可以尝试调高 CFG;当图像看起来“塑料感”重或颜色怪异时,应调低 CFG。
- 种子(Seed):种子决定了随机噪声的起点。固定种子,在微调提示词后重新生成,可以直观地对比出提示词修改带来的变化,是调试提示词最有效的方法。
4.2 迭代优化流程:以“森林中的精灵骑士”为例
假设我们的目标是生成“一位身穿藤蔓与花朵编织的轻甲、手持发光长矛、站在发光蘑菇森林中的精灵女骑士”。
第一版(基础描述):
1girl, elf, knight, vine armor, glowing spear, mushroom forest结果分析:角色可能是精灵,但盔甲细节模糊,森林没有发光感,构图普通。画面元素混杂,重点不突出。
第二版(增加细节和风格):
(masterpiece, best quality), 1girl, beautiful elf knight, intricate armor made of vines and glowing flowers, holding a long spear that emits soft blue light, standing in a bioluminescent mushroom forest, fairytale style, digital painting结果分析:画面质量提升,有了童话感。但“精灵”特征可能不够明显(尖耳?),“发光”程度不足。
第三版(精确化与权重调整):
(masterpiece, best quality, intricate details:1.2), 1girl, (elf with long pointed ears:1.3), (knight in elegant armor woven from glowing vines and luminous flowers:1.4), holding a (long crystal spear emitting radiant blue light:1.3), standing in a (dense forest of giant, bioluminescent mushrooms:1.2), (ethereal glow:1.3), fantasy art, by Alphonse Mucha and WLOP同时优化负面提示词:在通用负面词基础上,加入
(dark, gloomy:1.2), modern clothing, gun来确保氛围明亮,且不会出现现代物品。调整参数:Steps: 35, CFG: 9。
通过这样三步迭代,我们从一个模糊的概念,得到了一张细节丰富、主题明确、风格统一的图像。每一次修改都基于对上一次结果的分析,这就是提示词工程的核心工作流。
5. 高级策略与灵感获取
当你熟练了基础技巧后,可以探索一些更高级的策略来创造独特或复杂的图像。
5.1 使用艺术家与风格混合
在提示词末尾添加by [艺术家A] and [艺术家B],可以尝试融合两位艺术家的风格。例如by Hayao Miyazaki and Moebius会混合宫崎骏的清新与墨比斯的科幻线条感。但这需要实验,有时会产生意想不到的冲突。
5.2 利用 LoRA 与 Embedding 模型
对于非常具体、难以用文字描述的概念(如某个特定游戏角色、一种独特的画风),可以训练或下载对应的 LoRA(低秩适应)模型或 Textual Inversion(嵌入)模型。使用时,在提示词中加入特定的触发词,如<lora:MyCharacterStyle:0.8>,就能以极小的计算量将该风格或角色特征注入到生成过程中。这是实现高度定制化输出的强大工具。
5.3 反向工程与灵感库
当你看到一张惊艳的 AI 作品时,可以尝试“反推”它的提示词。一些工具和网站提供此功能。即使不能完全反推,观察其描述的结构、使用的风格词和质量词,也是极好的学习材料。建立自己的“灵感库”,收藏优秀的提示词案例并分类整理(如“赛博朋克城市”、“奇幻肖像”、“静物摄影”),在需要时进行参考和改编,能极大提升效率。
5.4 应对“AI味”与追求独特性
热词中提到的“去AI味的提示词”,是一个高阶课题。“AI味”通常表现为过度平滑的质感、不自然的光影、程式化的构图和细节。要减弱它,可以尝试:
- 增加真实世界的“不完美”:在提示词中加入
film grain(胶片颗粒)、slight motion blur(轻微运动模糊)、shallow depth of field(浅景深)、natural lighting(自然光)、asymmetric composition(不对称构图)。 - 引用特定摄影技术:如
shot on 35mm film(35毫米胶片拍摄)、Leica M10 photo(徕卡M10拍摄)。 - 使用更独特的艺术家:避免过度使用如 Greg Rutkowski 等被 AI 过度学习的艺术家,尝试寻找风格独特的小众艺术家名字。
- 后期微调:在 Stable Diffusion 的图生图功能中,以低重绘强度(如0.2-0.3)使用原图+更精细的提示词进行重绘,可以添加细节和打破过度规则化的图案。
最后,提示词工程是一门实践的艺术。没有放之四海而皆准的“完美公式”,最好的学习方法就是动手去试,大量地生成,仔细地对比,耐心地调整。从模仿优秀的案例开始,逐步形成自己的描述语感和风格偏好,这才是从“使用者”迈向“创作者”的关键一步。