写提示词这事,说难并不难,说简单也真没那么简单。尤其到了衣物和身材这个层面,很多新手容易卡住——明明人物面部已经很精致了,衣服却皱成一团,或者身体比例怎么调都不对劲。这篇是人物高级提示词的(二),上一篇聊了基础脸部和发型,这篇专门拆解衣物描述和身材控制这两大块。内容既包含stable diffusion提示词里关于服装材质、剪裁、配色、皱褶的底层写法,也包含体型骨架、比例、动态姿态的高阶控制思路,还配了完整案例和踩坑记录。无论你用的是SDWebUI还是ComfyUI,这套方法论都适用,算是一份可以直接抄作业的进阶参考。
1. Stable Diffusion理解衣物和身材的方式
很多教程上来就甩一堆提示词清单,不解释原理,导致你换了个模型、换了个画风就失灵。想真正掌控出图效果,得先搞明白stable diffusion是怎么“看”你这段文字的。
1.1 关键词是分块解析的,不是逐字阅读
Stable Diffusion的文本编码器(CLIP Text Encoder)会把你的提示词拆成一个个token,每个token对应一个向量空间里的位置。这意味着两件事:第一,模型更认标准的、常见的英文词汇,太偏门的词或者纯中文描述它容易理解成抽象概念;第二,词与词之间的组合语义比简单堆砌词条更有效。
举例来说,a girl in a red dress这个描述,在SD1.5系列模型里会被解析成“女孩”“红色的”“连衣裙”三个主要特征块。但如果你写she is wearing a flowing red gown with delicate straps,模型对衣物的理解就从“一件衣服”细化成“流动感”“红色长裙”“细肩带”多个维度,出图的服饰细节明显更丰富。
所以写高级提示词的第一原则是:把大概念拆成可渲染的小特征。想要一条皮裙,不要只写leather skirt,要拆成matte black leather skirt、fitted silhouette、visible seam lines这样三层递进。
1.2 权重语法到底怎么用才有效
在SDWebUI或ComfyUI里,(关键词: 1.2)这种格式可以放大某个词的影响,但很多人用法是错的。权重不是越高越好,尤其对于衣物这类强结构化内容,超过1.5往往会让布料纹理出现伪影,或者衣服夸张变形。
另一个常见的低效用法是反复叠加同样的词:elegant dress, elegant dress, elegant dress。这在真人照片类模型里作用极其有限,因为CLIP会把重复token当作强调信号,但不会线性增强语义。更好的做法是用近义词扩展维度,比如elegant dress, refined gown, graceful styling,让模型从不同角度理解“优雅”这个抽象概念。
在ComfyUI里还可以精细控制每个关键词的权重,比如对材质词和颜色词分贝调节,实际使用中发现材质词权重略高、颜色词权重略低,出图效果更自然。颜色只需要描述准确即可,过高的权重会让色彩生硬得像油漆涂上去。
1.3 负面提示词是调节“崩坏”的开关
衣物和身材的控制,有一半功劳在负面提示词。很多崩坏不是模型画不好,而是没有得到足够明确的限制。
举两个真实案例。我们画旗袍时,如果不加负面提示,模型很容易把开衩画成布条缠绕,这是因为“开衩”和“破碎”在特征空间距离接近。加上entangled fabric, tattered cloth, messy draping后,开衩的位置和形态会干净很多。再比如画露肩装,偶尔会出现肩带浮空、衣服贴在身体上但没有厚度的情况,加上floating straps, clothes sticking to skin unnaturally能明显改善。
身材方面的负面词更关键:bad proportions, deformed limbs, extra arms, mutated hands这些基础负面词是必须的。针对特定需求还可以加masculine shoulders(画女性时避免肩太宽)、thick waist(想突出腰身时)、short legs(想拉长腿部线条时)。这些负面词的本质逻辑是:把你不希望出现特征强相关区域拉低,从而让正面描述的特征更突出。
2. 衣物提示词的核心写法:从材质到剪裁
衣物描述是stable diffusion人像里最体现细节功力的部分,也是新手进阶的分水岭。这一节按材质、款式、细节、配色四个维度逐步拆解。
2.1 材质词:先定“触感”,再谈款式
模型生成衣物时,材质词决定了衣服的“视觉触感”。同样一件风衣,leather trench coat和cotton trench coat出来的质地完全不是一个东西。材质词要放在衣物名词前,并配合光感修饰词,效果最稳定。
以几种常见材质为例:
- 丝绸/缎面:
silk,satin,flowing sheen,smooth glossy texture。配合灯光词soft window lighting可以让高光更柔和。重点:不要写wet looking silk,很容易生成遇水贴身的效果,除非你真是要这个主题。 - 皮革:
matte leather,fitted leather jacket,subtle grain texture。如果希望皮衣有反光感,加polished shine;希望哑光感,则加matte finish。皮衣非常容易画臃肿,负面词建议加bulky leather, puffy sleeves。 - 蕾丝:
delicate lace trim,intricate lace pattern,see-through fabric。蕾丝用到裙子下摆或袖口时效果最好,大面积使用极容易翻车。反面案例:full lace dress经常生成像渔网袜一样的恐怖纹理。 - 牛仔:
blue denim,faded wash,visible stitching。牛仔裤面料最怕画成软塌塌没有厚度,加structured thickness可缓解。 - 西装/正装:
tailored blazer,sharp shoulder line,structured fit。西装想画出高级感核心在肩线,这个部分对应提示词是well-fitted shoulder seam,效果比单纯写formal suit好很多。 - 针织/毛衣:
chunky knit,cable-knit sweater,soft wool texture。针织最容易翻车的地方是花纹,绞花和麻花纹理经常画成乱糟糟的线条,建议用chunky cable-knit这种指定纹理,不要写abstract knit pattern这种过于模糊的词。
2.2 款式词:剪裁决定气质
材质让衣服有质感,款式词决定衣服的版型和气质。这一层是高级提示词和基础提示词拉开差距的地方。
按服装类别整理几个高复用关键词:
- 油画风长裙:
flowing maxi dress,A-line silhouette,empire waistline。油画风里经常见到这种大裙摆,重点是裙子的垂坠感和腰线位置。 - 包臀裙:
pencil skirt,fitted hips,knee-length hem。关键词重心放在hips和waist的贴合度,形容词优先使用snug、streamlined。 - 短上衣/辣妹风:
crop top,high-waisted bottoms,cropped silhouette。搭配建议把crop top和high-waisted隔着两个描述词同时出现,模型更容易理解整套着装的上下比例。 - 露背裙:
backless dress,open back,strappy back detail。露背裙要想画出自然状态,最好在提示词里说明镜头视角是back view或three-quarter back angle,否则模型默认画正面,你输入的露背特征只能靠想象力生成,结果往往很奇怪。 - 复古系:
vintage style,puff sleeves,high neckline,cinched waist。复古装束对细节点要求极高,建议分部位给予描述:袖口、领口、腰线各一至两个特征,不要试图把五个复古元素塞进同一件衣服里。 - 改良汉服:
hanfu style,crossed collar,flowing layers,ribbon belt。汉服关键词在SD1.5里经常失准,建议配合traditional Chinese clothing一起写,或者直接用国风底模。注意,不同模型对“汉服”的理解差异巨大,写实模型容易画成民国风,二次元模型容易画成仙侠风,只能多测试。
2.3 细节词:高级感的来源
判断一张图“高级”还是“粗糙”,衣服细节占了很大权重。同样是一件白衬衫,有pleats和没有pleats出来完全是两个观感。
比较实用的细节词包括:
- 褶皱:
fabric folds,natural wrinkles at elbows,draped folds。提示词要给出褶皱的位置(如elbows、waist)而不是泛泛写wrinkles,模型才能画到对的地方。 - 缝合线:
visible stitching,contrast stitching。牛仔和皮衣最好用,能让衣服有工艺感。 - 领口袖口:
ribbed cuffs,folded collar,button-up front。 - 不对称设计:
asymmetric hem,one-shoulder design,diagonal cut。 - 束腰细节:
corset lacing,belted waist,drawstring waist。
这里有一条实战经验:细节词占总提示词的比例不宜超过15%。太多了模型会陷入“细节选择困难”,有时候给出8个细节词,出图反而不如给3个精准缺陷词的。核心逻辑是——你想要一件什么样的衣服,给出一到两个标志性细节就够了,其他留给模型脑补。
2.4 配色控制:色彩是氛围的定调者
衣物配色这块,我踩过不少坑。最初写提示词喜欢堆砌颜色:red and gold dress, blue scarf, white shoes,结果模型画出一件五彩斑斓的衣服,人物整体气质全无。
正确的配色控制有两种思路:
思路一:整体色调词托底。写soft pastel color palette,warm earth tones,monochrome styling一类的全局色调词,让模型在统一的色调范围内做搭配。这种方法对新手最友好,不容易翻车。
思路二:主色+点缀色结构。描述顺序是先主色、后辅色、最后强调色。例如:an elegant princess in a floor-length crimson gown with gold embroidered details and a tiny emerald necklace。这种写法能让模型把视觉重心放对地方。
还有一个小技巧:用(color name: 1.1)给颜色词加轻微的权重,比重超过1.3就会出现漆面质感。想画好丝绸质地的红裙,crimson silk比red dress的可控性高很多,因为“红色”在特征空间的分布太宽泛了。
3. 身材提示词的核心框架:骨点比例与线条感
衣物是皮,身材是骨架。衣服画得再好,身体比例崩了依然全盘皆输。这一节讲身材描述的底层逻辑和实操词库。
3.1 不要硬写数字,要写视觉描述
很多人想画大长腿,直接写long legs,想画细腰,直接写thin waist,结果经常画成比例失衡的怪物。根源在于SD模型对“尺寸类形容词”的泛化能力有限,long到底多长、thin到底多细,模型没有稳定的标准。
更有效的写法是描述线条和轮廓比例:
- 腿部:
slender legs,toned thighs,slim ankles,elongated leg line。其中elongated leg line是一种线条描述,比直接写long legs稳定得多,而且和镜头角度配合很好。 - 腰身:
narrow waist,hourglass silhouette,defined waist curve。defined waist curve是我目前觉得最稳的一个词。 - 肩颈:
slender neck,delicate collarbone,straight shoulder line。straight shoulder line同时控制肩宽和仪态,比perfect shoulders这种模糊赞美词好用太多。 - 整体身形:
slim build,athletic figure,curvy body with a narrow waist。注意,slim和thin在我的测试里常常是一键切换,slim更倾向于健康匀称,thin容易过度瘦削加轻微畸形。
3.2 体态与身高比:让画面更“高级”
高级身材提示词要处理的是“人体工程学”层面的信息,包括头身比、上下半身比例、动态线。
- 头身比:漫画风常用
long legs, eight-head body proportions,写实风不要这么写,容易出现奇怪拉伸。写实模型用natural body proportions更稳。 - 上下身比:
high waistline,long torso,short torso。注意,high waistline描述的是视觉腰线高,不是腰的位置高,这个特征配合高腰裤或高腰裙时效果极好。 - 整体身体框架:建议用“大词+细节补充”的结构。例如:
petite frame with slender arms and graceful posture,先说框架,再说局部,然后是气质补充。
这里有个细节:如果你想画肌肉线条但不夸张,用defined muscle tone比muscular更合适。muscular在部分模型里会直接触发健美风格,肌肉块感过强,和普通人物氛围极不搭。
3.3 身材与视角联动控制
这是很多人忽略的一环。同样是“腿部优美”这个需求,视角不同提示词写法完全不同:
- 全身远景:强调
full body shot+full-length view+ 整体身形,适合表现身体比例和服装剪影。 - 七分身(膝盖以上):强调
three-quarter shot+ 腰臀曲线 + 裙摆细节。 - 特写(腰部到头部):强调
medium shot+upper body focus+ 领口肩颈细节。
结合视角来写身材词,可以强制模型把有限的采样资源放在正确的位置。否则你写了三段完美身材描述,但镜头只给到头肩特写,模型把那些特征堆在头上,又会出现畸形。
实际操作中有个例子:我想生成一张“穿露背长裙、回眸看镜头”的照片。一开始写的是beautiful back view, elegant dress,效果一般,背景乱、肩膀宽。后来改成three-quarter back angle, bare back in a flowing maxi dress, looking back over shoulder, graceful posture, slender waist,把视角(three-quarter back angle)、露肤部位(bare back)、身材词(slender waist)分开控制,出图稳定性和姿态美感都大幅提升。
3.4 分部位身材词搭配表
为了方便对照,我把常用身材描述词按部位和风格整理成下面这个表,可以根据需求自由组合。
| 部位 | 纤细/匀称风 | 丰满/曲线风 | 力量/运动风 |
|---|---|---|---|
| 整体 | slim build | hourglass figure, busty curves | athletic build, toned physique |
| 肩部 | delicate shoulders, narrow build | soft shoulders | broad shoulders, defined deltoids |
| 腰部 | slender waist, nipped-in waist | soft waist, feminine waistline | firm core, muscular waist |
| 手臂 | slender arms, delicate hands | soft arms | toned arms, visible biceps |
| 腿部 | slender legs, slim calves | shapely thighs, curved hips | strong thighs, defined quads |
| 颈部 | long slender neck | graceful neckline | thick strong neck |
组合时的推荐结构是:先写整体形,再写2到3个重点部位,然后加上一个动态或姿态词收尾。不要试图把上表里面的词全塞进一条提示词,重点控制两个部位就足够了。
4. 实操:一套高复用的人物衣物身材提示词方案
理论讲再多,不如直接上手跑一遍。这部分分享一套我现在常用的“三层式”提示词模板,用这套模板,基本上给任何角色换装换身材,替换一套提示词组就能搞定。
4.1 三层式提示词结构
我把提示词分成三个层次:底层质量词、中层人物/服装特征词、顶层画面控制词。
底层质量词(保证画质和基础构图):
masterpiece, best quality, highly detailed face and skin, realistic lighting, 8k uhd, sharp focus中层人物与服装特征词(按需求替换,如下例是“东方女性穿改良旗袍”):
a confident Chinese woman, 24 years old, elegant charm, slim hourglass figure, wearing a modern qipao, floor-length skirt with side slit, high mandarin collar, champagne silk material, delicate floral embroidery, slim waistline, graceful posture顶层画面控制词(镜头与氛围):
full body shot, soft studio lighting, blurred urban background, warm color grading, cinematic composition4.2 一个从平庸到进阶的完整案例对比
以一个“穿红裙子的女人”为例,展示提示词怎么从入门进化到可控。
基础版(新手常用):
a beautiful woman in a red dress, long hair, pretty face, nice body出图结果不稳定,衣服形态不可控,红色容易溢出到皮肤,以及身体比例偶尔崩。
进阶版(结构清晰但有明显短板):
a beautiful woman in a red silk dress, elegant, slim waist, long legs, soft lighting, full body shot比基础版好了不少,但裙子的材质感还是不够,有时候会出现裙摆乱飞或褶皱过于密集,光泽感不足。
高级版(推荐使用):
a sophisticated woman in a floor-length crimson silk dress, delicate spaghetti straps, subtle sheen on fabric, fitted bodice, flowing A-line skirt, natural waist emphasis, slim silhouette, confident posture, bare shoulders, full body shot, golden hour lighting, soft shadows, cinematic warmth高级版把“红色裙子”这个模糊概念拆成了衣长(floor-length)、材质(silk)、颜色(crimson)、肩带(delicate spaghetti straps)、版型(fitted bodice + flowing A-line skirt)、腰线(natural waist emphasis)、光泽(subtle sheen)等多个维度,模型出图时对衣物的每一个部分都有了明确的参考目标,所以成功率大大提升。加上负面词配合,一次出四张图至少有两张能直接用。
4.3 配合参数:提示词好的一半功劳在参数
提示词写得再漂亮,采样参数不对也白搭。衣物和身材这类细节丰富的图,我推荐的参数组合是:
- 采样器:DPM++ 2M Karras,这个组合对细节还原与速度平衡最舒服,衣物纹理很少出现油画感。
- 迭代步数:28到32步。步数高于40时,衣物的细纹开始被过度渲染,容易出现塑料感。
- CFG Scale:7到8之间。衣物细节少的图可以降到6,细节多(比如刺绣、褶皱、蕾丝)建议8到9,但不要超过10,否则会出现布料纹理雕刻感。
- Hires fix:放大倍数1.5到2,降噪强度0.3到0.4。低降噪能保留衣物的小褶皱和材质纹理。
ComfyUI用户同理,在KSampler节点里对应设置即可。特别提醒:ComfyUI里不同版本的采样器名称有差异,但DPM++ 2M Karras在主流版本里稳定性都很好。
4.4 测试阶段的高效方法
做衣物和身材提示词测试时,强烈推荐用SDWebUI的Prompt Matrix或脚本里的X/Y/Z Plot。把固定seed,然后批量对比不同关键词组合,一次批量出十几张图,效率远高于一张一张调。
我自己常用的测试组合流程:
- 固定seed和一副基础女性角色提示词(脸、发型写好)。
- 维度A:材质词切换(silk、satin、cotton、leather)。
- 维度B:剪裁词切换(A-line、pencil、slip、maxi)。
- 两张图一个对照组,比完成后选出最佳的材质+剪裁组合。
这套方法帮我建立了个人词库,哪些词在什么模型上有效,哪些词跟哪些风格冲突,全部一目了然。比看十篇教程都有用。
5. 常见问题与排查技巧实录
最后这部分,把我踩过的坑和读者问得最多的问题梳理一下。这些都是实打实的经验,很多在官方文档或教程里很难找到。
5.1 衣服材质画不出真实感怎么办
问题表现:明明写了leather jacket,出图像塑料雨衣;写了wool sweater,出图像纸片折的。
排查思路:
- 先检查采样器和CFG。高CFG(10以上)会导致材质纹理被过度锐化,塑料感暴增。降低CFG到7左右,很多材质问题自动消失。
- 检查模型底模类型。写实类底模(如ChilloutMix、MajicMIX)对材质表现力明显优于通用底模,如果出图发“油”,优先换写实底模。
- 检查正面提示词是否堆叠了过多的细节词。材质真实感的核心是“光在物体表面的反射”,所以加一个
soft studio lighting或diffused window light,往往比换更多材质词更快见效。
我常用的一套快速修复快捷键:(material texture: 1.1) + (soft light: 1.2) + (matte or glossy finish) + 负面词plastic texture, cheap material,一套组合下来,布料的物理感提升明显。
5.2 身体比例总是崩怎么办
身体比例崩有两种情况,一种是整体失调(头大身子小、腿长没边),一种是局部畸形(多手指、腿扭曲)。
整体失调的解法:检查你使用的底模,Civitai下载页面一般会标注推荐的正负面提示词。以人物写实模型为例,绝大多数推荐负面词类似:
bad anatomy, bad hands, missing fingers, extra digit, fewer digits, cropped, worst quality, low quality, normal quality, jpeg artifacts, signature, watermark, username, blurry请不要删掉其中任何一项,这些是针对该模型训练数据统计出来的高频崩溃点。
局部畸形还有一个特殊的隐性原因——提示词写太挤了。同一个部位写了超过三个特征词,模型在该区域的特征交叉密集,极易引发耦合崩坏。解决方式是精简该部位描述,保留最核心的两个词即可。
5.3 衣服颜色“染色”到皮肤上怎么办
这大概是衣物提示词最烦人的问题。穿了红裙子,结果脸和脖子也泛红;穿了蓝衬衫,手部发青。
原因多半是颜色词权重过高。当某个颜色词权重超过1.5,它可能不只在衣物区域生效,还会通过CLIP特征传播到相邻的皮肤区域。解法很简单:
- 把颜色词的权重降到1.1到1.2之间。
- 在负面词中加入
color bleeding, skin discoloration, dye on skin。 - 在描述中加入
fabric dye staying on clothing, clean separation between cloth and skin这种显式边界描述。
还有一个很实用的小技巧:不要用“红色”表述红色,试着换成具体的红“crimson”、“scarlet”、“ruby red”等,这些词在特征空间里更贴近颜色属性本身、更孤立,不容易扩散到周围皮肤。
5.4 不同模型之间提示词不互通怎么办
很多朋友会遇到这类问题:在ChilloutMix里跑得好好的提示词,换到GhostMix或SDXL模型之后完全失效,衣服款型全变了,材质也变了。
这是正常现象,因为不同模型训练时使用的标签体系不同。比如SDXL模型对自然语句的理解力明显提升,一句话描述一个场景往往比关键词堆砌更好用;而SD1.5的各款二次元模型还是依赖较为固定的tag组合。
跨模型适配的基本策略是:保留语义内核,更换表面措辞。比如SD1.5里用red dress, elegant, detailed,到SDXL里可以改成a beautiful woman wearing an elegant red dress, highly detailed fabric texture。把“词标签式写法”转成“句子描述式写法”,大多数情况下能够保持相近的出图效果。
5.5 女性身材画得太“雄壮”怎么办
这个坑虽然常见,但多数教程不会提。写了一堆“曲线、细腰、长腿”的提示词,出图却是虎背熊腰。
原因通常是你写的其他修饰词触发了感性的身体框架。比如strong character、powerful charisma这类词汇,在特征空间里可能连着强壮的躯干。第二个原因是镜头视角,低角度仰拍会让整个人看起来宽大。
解救方案:
- 正面词强化骨架小信号:
petite frame,budget-friendly body structure, 其实更推荐直接用delicate bone structure,这个词比slim更能让整个骨架收窄。 - 负面词增加:
broad shoulders, bulky body, thick arms, heavy jawline。 - 检查提示词里是否混入了力量型或霸气型的气质词,有则删除或者降低权重。
5.6 固定的几张好图但换个服装关键词就全崩了怎么处理
这一个问题快被问烂了——“我保持seed不变,只换了一件衣服的描述,人就完全变形了”。原因在于,当你改动提示词后,即使seed不变,整个画面的语义共生关系也被破坏了。具体点说,你换掉的衣物词原本和其他几十个词相互共振,共同锁定了人物的姿态、构图、面部特征,一旦换掉,这些信息同时松动。
处理办法是换词不换结构。无论衣物怎么换,都要保持“人物核心标签+衣物结构词+镜头词+画质词”的顺序和语义层次不变。用我上面的三层式提示词框架去套,人物部分完全不动,只替换衣物那个槽位的词组,崩的概率就会大幅降低。
5.7 负面提示词速查表
根据不同失败现象,可以自由组合以下负面词,我统一整理如下:
| 失败现象 | 优先加入的负面提示词 |
|---|---|
| 衣服崩坏、布料缠绕 | entangled fabric, broken clothes, messy folds |
| 衣服塑料感、廉价感 | plastic texture, toy-like, CG render, cheap material |
| 皮肤颜色异常 | skin discoloration, color bleeding, unhealthy skin |
| 身材比例失调 | bad proportions, deformed limbs, unnatural body shape |
| 腿部崩坏 | extra legs, twisted legs, deformed feet |
| 肩膀过宽、男相 | broad shoulders, masculine features, heavy jawline |
| 整体画质崩坏 | worst quality, low quality, blurry, noise, jpeg artifacts |
这套负面词速查表我维护了挺久,基本每次翻译不同风格图时都能直接拿来用。建议你自己也建一个,碰到一个翻车案例就往对应的负面词列表里添加一条,用久了就有属于自己的“避坑指南”。
结尾:多说几句实用的
写了这么多,最后分享一点个人感受。很多人以为提示词就是“背单词、背模板”,但其实提示词设计的本质是精准的目标翻译——把你想看到的画面,转化成模型能理解的语言。衣物和身材这两个维度恰恰是最考验这种翻译能力的,一个是对“质感”的还原,一个是对“比例”的控制,两者都讲究克制和细致。实在拿不准的词,多跑几组对比图,亲手感受一下差异,比背一万条提示词都有用。另外工具的使用也要跟上:SDWebUI的X/Y/Z Plot你值得拥有,ComfyUI的提示词节点则更适合做复杂的条件组合。最后想提醒一句,衣物与身材提示词效果和底模息息相关,同一个词在写实模型、二次元模型、3D渲染模型上表现差异很大,最好的方式还是照着这个方法论,围绕你手头的常用模型建立起一套属于自己的词库体系。