在实际使用 AI 生成漫画、短剧或进行各类内容创作时,一个普遍且核心的痛点在于:我们精心构思的提示词,AI 似乎总是“理解”得似是而非。你想要的是一场充满张力的雨中打斗,AI 却可能生成一个阳光明媚的公园场景;你希望角色表情是“隐忍的悲伤”,AI 给出的却可能是“面无表情”。这背后的关键,往往不是 AI 能力不足,而是我们与 AI 的“沟通语言”——提示词——不够精确。提示词工程,正是为了解决这一沟通鸿沟而生的系统性方法。
本文旨在为开发者、内容创作者和 AI 应用实践者提供一个可操作、可复现的提示词撰写框架。我们将从 AI 理解文本的基本原理出发,逐步拆解如何将模糊的创意转化为 AI 能够精确执行的指令。无论你是想用 Stable Diffusion 生成分镜,用 Midjourney 设计角色,还是用大语言模型编写剧本,其底层逻辑是相通的。通过本文,你将掌握一套从概念到细节的提示词构建方法,并学会如何通过迭代优化,让 AI 真正“看懂”你的意图,产出符合预期的内容。
1. 理解 AI 如何“阅读”你的提示词
在开始撰写提示词之前,我们必须先摒弃人类自然语言的模糊性思维,转而用 AI 的“视角”来思考。AI 模型,无论是文生图模型还是大语言模型,其核心是一个基于海量数据训练而成的概率模型。它并不真正“理解”语义,而是根据你输入的词汇序列,计算并预测最可能与之关联的输出。
1.1 词元化与注意力机制
当你输入“一个穿着红色斗篷的骑士在月光下”时,模型首先会将这句话进行“词元化”处理。对于英文,这可能被拆分为["a", "knight", "in", "red", "cloak", "under", "moonlight"]等词元;对于中文,则是["一个", “穿着”, “红色”, “斗篷”, “的”, “骑士”, “在”, “月光下"]。每个词元都被转换为一个高维向量(嵌入向量)。
随后,模型内部的“注意力机制”开始工作。它会计算所有词元向量之间的关系强度。例如,“红色”会与“斗篷”和“骑士”建立强关联,“月光下”会与整体氛围建立关联。但这种关联是统计意义上的,而非逻辑意义上的。如果提示词过于复杂或矛盾,注意力可能会被分散,导致核心元素丢失。
1.2 提示词的权重与顺序
大多数 AI 模型对提示词中的元素存在隐式的优先级。通常:
- 靠前的词汇权重更高:模型会更重视句子开头的部分。因此,应将核心主体放在最前面。
- 重复的词汇权重会增加:反复提及某个关键词会强化该概念在生成结果中的体现,但过度重复可能导致图像扭曲或文本冗余。
- 否定词效果微弱:直接使用“不要”、“非”等否定词(如“不要有树”)效果很差,因为模型是基于正向关联训练的。更好的做法是明确描述你“要”什么。
理解这些机制后,我们就能明白,一份“AI 能看懂”的提示词,本质上是一份为概率模型精心设计的、去模糊化的“数据查询指令”。
2. 构建高质量提示词的通用框架:结构化与分层
散乱的描述很难被 AI 有效处理。我们需要一个结构化的框架来组织思想。一个高效的提示词通常包含以下几个层次,我们可以将其想象为给 AI 下达的“拍摄指令”。
2.1 核心指令层:主体、动作与环境
这是提示词的骨架,必须清晰无误。
- 主体 (Subject): 谁?是什么?必须最先明确。例如:“一位东亚女性机甲师”、“一座未来主义的悬浮城堡”。
- 动作/状态 (Action/State): 在做什么?处于何种状态?例如:“正在检修巨大的机械臂”、“寂静地漂浮在云海之上”。
- 环境 (Environment): 在哪里?背景是什么?例如:“在充满蒸汽管道的昏暗车间里”、“在霞光漫天的破晓时分”。
基础示例对比:
- 模糊提示:“一个骑士。”
- 结构化提示:“主体:一位伤痕累累的北欧风格骑士,动作:单膝跪地,将断剑插入焦土,环境:暴雨如注的荒原战场,背景是燃烧的城堡。”(适用于文生图)
- 结构化提示:“写一段开场戏。主体:一位落魄的私家侦探。动作:在雨夜中跟踪目标时,意外卷入一场黑帮交易。环境:20世纪40年代洛杉矶的后巷。”(适用于大语言模型写剧本)
2.2 细节描述层:外观、风格与质感
在骨架之上添加血肉,使内容具体化。
- 外观 (Appearance): 服装、发型、饰品、体型、面部特征等。使用具体的名词和形容词。例如:“身着绣有金色纹路的黑色皮风衣”、“留着利落的银色短发,左眼有一道疤痕”。
- 风格参考 (Style Reference): 指明艺术风格、电影风格或艺术家风格。例如:“赛博朋克风格,霓虹灯光效”、“宫崎骏动画电影风格”、“摄影风格,类似电影《银翼杀手2049》的暗调”。
- 质感与渲染 (Texture & Rendering): 描述画面或文本的质感。例如:“虚幻引擎5渲染,细节逼真,全局光照”、“水墨画风格,笔触晕染”、“胶片颗粒质感,浅景深”。
2.3 技术参数层:引导模型输出格式
这一层直接告诉 AI 输出的技术规格,对于生成内容的一致性至关重要。
- 对于文生图/视频模型:
--ar 16:9(宽高比)--style raw(风格化强度,Midjourney)--seed 12345(种子值,用于复现结果)negative prompt: blurry, deformed, ugly(负面提示词,明确排除不想要的元素)
- 对于大语言模型:
- “以剧本格式输出,包含场景描述、角色对话和动作提示。”
- “输出一个包含五个步骤的解决方案列表。”
- “用中文回复,语言风格专业且简洁。”
2.4 负面提示词:明确排除项
负面提示词是高质量输出的关键保障,它用于降低生成不良内容的概率。不要只说“不好看”,要具体。
- 通用负面词:
low quality, worst quality, bad anatomy, deformed, disfigured, mutation, extra limbs, missing limbs, floating limbs, disconnected limbs, malformed hands, blurry, watermark, signature, text, username, error. - 场景特定负面词:如果你画室内场景,可以加
outdoor, landscape;如果你画现代人物,可以加medieval armor, ancient。
将以上层次组合起来,就形成了一份结构清晰的提示词:
(核心指令)一位女特工在布满全息屏幕的未来都市天台追逐目标,(细节描述)她身穿紧身光学迷彩服,发型是高科技感的蓝色渐变短发,眼神锐利,城市背景是密集的立体交通和巨大的悬浮广告牌,(风格质感)赛博朋克风格,霓虹灯光污染,电影感构图,景深效果,细节锐利,(技术参数)8K, professional photography, --ar 2:1 --style expressive (负面提示)negative prompt: cartoon, 3d render, anime, sketch, lowres, ugly, duplicate, morbid, mutilated, extra fingers, poorly drawn hands, poorly drawn face, mutation, deformed, blurry, bad anatomy, bad proportions3. 针对“AI漫剧”与“短剧制作”的提示词专项优化
“漫剧”和“短剧”是连续叙事,要求角色一致性、场景连贯性和情节推进感。这对提示词提出了更高要求。
3.1 角色一致性提示词设计
角色在不同画面中必须保持可辨识度。仅靠文字描述很难保证,需要结合技术手段。
- 创建角色“身份证”:为每个主要角色撰写一份详细的描述文档,包括:
- 基础档案:姓名、年龄、性别、种族。
- 外貌锚点:发型发色、瞳色、脸型、标志性特征(如痣、疤痕、特定饰品)、体型。
- 服装主题:主色调、服装风格(如“复古西装”、“机能风外套”)。
- 在提示词中嵌入“身份证”:每次生成该角色时,都将其“外貌锚点”和“服装主题”作为核心描述的一部分。例如:“[主角小林],黑色短发,左耳戴银色十字架耳钉,身穿黑色机车皮夹克,...”。
- 利用角色LoRA或Reference:对于Stable Diffusion等平台,可以训练角色的LoRA模型,或在生成时使用“Reference”功能上传角色设定图,这是保证一致性的最强手段。提示词中需加入触发词,如
(character_lora:1.2)。
3.2 场景与分镜提示词设计
漫剧由一系列分镜组成,每个分镜的提示词需承上启下。
- 场景描述连贯:如果上一镜在“咖啡馆内”,下一镜是“冲出咖啡馆”,那么下一镜的背景应包含咖啡馆的门面或街道,并描述天气、时间是否变化。
- 镜头语言明确:在提示词中使用电影术语,指导画面构图。
wide shot(全景):展示环境与人物关系。medium shot(中景):展示人物上半身和动作。close-up(特写):强调面部表情或关键道具。low angle shot(仰拍):表现力量、压迫感。over the shoulder shot(过肩镜头):用于对话场景。dutch angle(荷兰角):表现紧张、失衡。
- 分镜示例:
- 镜号1 (开场):
wide shot, 未来都市雨夜,霓虹灯光在湿漉漉的街道上反射,主角孤独地走在人群中,low angle shot 强调其渺小与环境的压迫感。 - 镜号2 (反应):
close-up on 主角的眼睛,瞳孔中倒映出突然出现的全息通缉令,眼神从迷茫转为震惊。 - 镜号3 (动作):
medium shot, 主角转身拔腿狂奔,在拥挤的人群中穿梭,motion blur 强调速度感。
- 镜号1 (开场):
3.3 情节与情绪提示词设计
情绪是驱动剧情的核心,需要通过环境、光影、色彩和人物状态来传达。
- 情绪词汇具象化:不要只说“悲伤”。用“天空下着淅沥的小雨”、“她独自坐在空荡房间的角落,手中握着褪色的照片”、“色调偏蓝,对比度低”来表现悲伤。
- 色彩心理学应用:
- 紧张/危险:
high contrast, red accent lighting, dramatic shadow - 温馨/回忆:
warm color palette, soft light, golden hour - 神秘/未知:
foggy, desaturated color, single light source
- 紧张/危险:
- 结合LLM生成分镜脚本:可以先使用 ChatGPT、Claude 等大语言模型,根据故事大纲生成详细的分镜脚本描述,再将每一镜的描述转化为文生图提示词。给 LLM 的提示词可以是:“你是一名资深漫剧分镜师。请为以下故事梗概设计10个关键分镜。为每个分镜提供:1. 镜号。2. 画面描述(包含场景、人物动作表情、镜头语言)。3. 本镜的情绪氛围和色彩建议。故事梗概:[你的故事]”
4. 迭代优化:像调试代码一样调试提示词
首次生成的提示词很少能完美命中目标。我们需要一个迭代优化流程。
4.1 分析与诊断
将 AI 的输出与你的预期进行对比,具体分析差距在哪里。
- 主体不对:检查主体描述是否足够前置和独特。增加更具体的限定词,或使用更罕见的词汇组合。
- 风格偏离:检查风格关键词是否准确。尝试更换风格参考(如从“anime”换成“studio ghibli style”),或调整风格化参数。
- 细节缺失:检查细节描述是否被淹没。尝试将关键细节移到提示词更前端,或用括号
()或方括号[]增加权重(不同平台语法不同,如(keyword:1.5)表示权重1.5倍)。 - 出现不想要元素:强化负面提示词。将生成结果中出现的瑕疵词(如“多余的手指”、“扭曲的窗户”)加入到负面提示词列表中。
4.2 A/B 测试与变量控制
一次只改变一个变量,观察结果变化,这是找到最佳提示词组合的科学方法。
- 固定种子:在文生图工具中,使用相同的
seed值。这样,每次生成时,模型的初始随机状态相同,输出的差异将完全由你改变的提示词部分导致。 - 变更单一要素:例如,保持主体、动作、环境不变,只将“油画风格”替换为“水彩风格”。或者,保持所有描述不变,只将宽高比从
--ar 4:3改为--ar 16:9。 - 对比记录:将不同变量下的输出结果并列对比,记录哪种表述更符合预期。
4.3 利用提示词辅助工具
- 提示词词典/浏览器:如《Stable Diffusion Prompt Book》或在 Civitai 等社区浏览高分作品的提示词,学习他人的有效描述组合。
- 提示词生成与优化插件:一些 AI 绘画工具内置或支持插件,可以帮你扩展、优化提示词,例如将“一个美丽的女孩”自动扩展为包含发型、五官、光影的详细描述。
- 分层提示词编辑器:使用支持分栏编辑的笔记工具或专用提示词编辑器,分别管理核心指令、细节、风格、负面词等,方便进行模块化调整。
5. 高级技巧与常见“坑”的规避
掌握了基础框架后,一些高级技巧和避坑指南能进一步提升成功率。
5.1 概念冲突与词汇污染
这是导致生成结果怪异的主要原因之一。
- 坑1:风格词汇冲突:例如,“中国水墨画风格”和“高度细节的写实渲染”在美学上是冲突的。AI 会试图融合,导致不伦不类。
- 解决:明确主风格,弱化或删除次要风格词汇。如果想结合,需寻找更精确的融合表述,如“具有水墨笔触感的数字插画”。
- 坑2:形容词歧义:“大”这个词可以形容体积、年龄、重要性。AI 可能无法区分。
- 解决:使用更精确的词汇。用“巨大的”、“年长的”、“关键的”来替代“大”。
- 坑3:文化特定概念:直接使用“武侠感”、“昭和风”等,AI 的训练数据可能无法精准关联。
- 解决:将其拆解为可视觉化的元素。“武侠感”可以拆解为:“古代中国服饰,长发束冠,手持长剑,在竹林或客栈场景中,动态姿势,带有气劲特效”。
5.2 权重与语法的精细控制
不同平台有各自的语法来调整关键词影响力。
- Midjourney: 使用
::分隔并赋予权重,如knight::1.5 red cloak::1.2 castle::0.8。数值越高,该概念影响力越大。 - Stable Diffusion: 使用
()增加权重,(keyword)约等于 1.1倍,((keyword))约等于 1.21倍,也可用(keyword:1.3)指定精确权重。使用[]降低权重。 - 通用技巧:过长的提示词会稀释每个词的注意力。通常,将最重要的 5-8 个概念放在前面并适当加权,效果优于罗列 50 个细节词。
5.3 从单张到连续的 workflow
制作漫剧不是生成单张图片的简单重复,而是一个工作流。
- 剧本与分镜:先用 LLM 敲定剧本和分镜描述。
- 角色定稿:使用第 3.1 节的方法,生成并确定主要角色的“标准像”。保存其提示词、种子和生成参数。
- 场景测试:对关键场景(如主战场、主要室内景)进行单独测试和定稿。
- 批量生成:利用 Stable Diffusion 的“文生图”批量脚本,或 Midjourney 的“Remix”模式,结合定稿的角色和场景提示词模板,替换其中的动作和镜头描述,来生成系列图。
- 后期统一:使用图像编辑软件或 AI 工具进行后期调色、光影统一,确保所有画面色调和质感一致。
5.4 常见问题排查清单
当生成结果持续不理想时,可以按此清单逐一检查:
| 问题现象 | 可能原因 | 检查与解决方向 |
|---|---|---|
| 主体完全错误或缺失 | 1. 主体描述太靠后或太普通。 2. 被其他强风格词汇淹没。 | 1. 将主体词置于提示词最前端,并增加权重。 2. 简化风格描述,先确保主体正确。 |
| 画面元素混乱、扭曲 | 1. 提示词内部概念冲突。 2. 负面提示词不足。 3. 模型本身能力限制。 | 1. 审查并移除冲突词汇(如同时要求“简约”和“繁复”)。 2. 加强负面提示词( deformed, ugly, bad anatomy)。3. 尝试不同的基础模型或检查模型是否擅长该题材。 |
| 风格不符合预期 | 1. 风格关键词不准确或模型不理解。 2. 风格化参数设置不当。 | 1. 更换风格表述方式(如用“by Hayao Miyazaki”代替“anime style”)。 2. 调整 --style、--stylize等参数。 |
| 角色在不同图中不一致 | 1. 仅靠文字描述,一致性极限低。 2. 提示词细节每次都有变动。 | 1. 使用角色 LoRA 或 Reference 功能。 2. 建立角色“身份证”并严格复制核心描述部分。 |
| 生成内容过于平淡 | 提示词缺乏戏剧性和构图指导。 | 加入镜头语言(wide shot, close-up)、光影描述(dramatic lighting, rim light)、情绪色彩(somber mood, cold color palette)。 |
让 AI 真正看懂你的意思,是一个将内部构思进行“翻译”和“编码”的过程。其核心在于放弃模糊的文学化描述,拥抱结构化的、机器友好的指令语言。从理解 AI 的工作原理开始,通过“核心指令-细节描述-技术参数-负面排除”的框架搭建提示词,再针对漫剧、短剧等连续性创作需求,专项优化角色、场景和情绪的表述。最后,像调试程序一样,通过迭代、测试和排查,不断精炼你的“提示词代码”。记住,最强大的提示词工程师,永远是那个最清楚自己想要什么,并能将其拆解为最基本视觉或文本元素的人。实践的开始,可以从为你最喜欢的一个电影场景或漫画格撰写提示词并尝试复现做起,这是锻炼这种“拆解-翻译”能力的最佳途径。