1. 从单张肖像到九宫格叙事:AIGC拼贴创作的魅力与挑战
最近在尝试用AIGC工具制作一种特别的肖像作品——3x3网格拼贴肖像。这听起来可能只是一个简单的图片排列,但实际操作下来,我发现它远不止是把九张图拼在一起那么简单。它更像是一种用AI进行的视觉叙事实验,一种将单一主题通过九个不同侧面进行解构与重构的创作过程。无论是想为朋友制作一份独特的生日礼物,还是想探索个人身份的多重表达,这种形式都提供了一个极具吸引力的框架。对于刚接触AIGC的朋友来说,这可能是一个绝佳的切入点,因为它有明确的规则(3x3网格),但同时又充满了无限的创意可能性;而对于资深玩家,这则是一个挑战提示词控制、风格统一与叙事连贯性的绝佳沙盒。
传统的肖像摄影或绘画,追求的是捕捉或创造一个“决定性瞬间”或“经典形象”。而AIGC制作的3x3网格拼贴肖像,其核心魅力在于“可能性”的并置。它不再回答“他/她是谁?”,而是试图探讨“他/她可以是什么样子?”。九个格子,可以代表九种情绪、九种风格、九个年龄阶段、九个平行宇宙中的身份,甚至是九种不同的艺术流派诠释。这种形式天然带有一种游戏感和探索性,非常契合AIGC“生成”与“涌现”的特性。当你看到同一个提示词(prompt)核心下,AI生成了九幅既相似又迥异的肖像时,那种奇妙的感受是传统媒介难以提供的。
2. 创作流程全解析:从构思到成品的九步心法
制作一幅令人印象深刻的3x3网格拼贴肖像,绝非一蹴而就。它需要一个从前期构思、中期生成到后期合成的完整工作流。下面我将以最常用的Stable Diffusion(搭配WebUI)为例,拆解整个流程中的关键环节与决策点。
2.1 第一步:核心主题与风格锚定
在打开任何AI绘图软件之前,最重要的工作是构思。你需要明确这幅拼贴肖像的“主题”是什么。这个主题可以是一个人(真实或虚构),一种职业(如“未来宇航员”),一种概念(如“孤独”),甚至是一个物体拟人化。主题是你所有提示词的“锚点”。
确定主题后,紧接着是选择“风格锚点”。风格决定了九宫格的视觉基调是否统一。你是想要写实摄影风格、古典油画质感、二次元动漫风、还是赛博朋克插画?风格锚定得越具体,后期生成的图片一致性就越高。例如,与其用“油画风格”,不如用“by Rembrandt, dramatic chiaroscuro lighting”(伦勃朗风格,强烈的明暗对比光线),这样AI对风格的理解会精准得多。
我的经验是,准备一个“风格关键词库”非常有用。平时看到喜欢的画家、摄影师、电影视觉风格、游戏美术风格,就把对应的英文关键词记下来。例如,想要细腻的光感可以加“by Greg Rutkowski”,想要复古科幻感可以加“synthwave, retrofuturism”。
2.2 第二步:构建“变量”与“常量”提示词体系
这是整个创作的技术核心。3x3网格的魅力在于变化,但变化中必须有不变的元素来维持整体感。因此,我们需要设计两套提示词:
常量提示词(Constant Prompts):这是贯穿九张图的共同基础。通常包括:
- 核心主题:如“a portrait of a young woman”。
- 基础风格:如“photorealistic, studio lighting, 8K”。
- 视角与构图:如“front view, upper body, looking at viewer”。固定构图能极大提升网格的协调性。
- 负面提示词(Negative Prompt):这是保证质量的关键“常量”。一套好的负面提示词可以过滤掉低质量特征,如“ugly, deformed, bad anatomy, blurry, watermark, text”。
变量提示词(Variable Prompts):这是制造九个格子差异化的关键。变量可以围绕多个维度设计,我常用以下几种套路:
- 情绪/表情变量:
smiling, laughing, serious, contemplative, angry, surprised, crying, neutral expression, sleepy。 - 时代/年代变量:
1920s flapper, 1950s vintage, 1980s punk, futuristic cyberpunk, medieval royalty。 - 艺术流派变量:
impressionism, pop art, art nouveau, ukiyo-e, surrealism。 - 环境/背景变量:
in a lush garden, in a cyberpunk city alley, in a classic library, in a spaceship cockpit, against a solid color background。 - 装饰/属性变量:
with glasses, with a hat, with flowers in hair, with mechanical arm, with neon tattoos。
- 情绪/表情变量:
实际操作时,我会先写好一套强大的“常量提示词”,确保单张出图质量。然后,准备一个包含9个不同“变量”的列表。每次生成时,将“常量”与一个“变量”组合,作为本次生成的完整提示词。
2.3 第三步:模型与参数的精调策略
选对模型等于成功了一半。对于肖像,我倾向于使用专门优化过人脸的融合模型或Checkpoint,比如epicphotogasm、Realistic Vision或ChilloutMix的某些版本。这些模型对人脸结构、皮肤质感的理解更深刻,能减少畸变。
关键参数设置直接影响九宫格的统一性和多样性:
- 采样器(Sampler)与步数(Steps):为了平衡速度和质量,
DPM++ 2M Karras或Euler a是不错的选择,步数设置在20-30之间。重要提示:九次生成必须使用完全相同的采样器和步数,否则画面颗粒、笔触等细节质感会不一致,拼贴后会显得很“脏”。 - 提示词引导系数(CFG Scale):这个参数控制AI听从提示词的程度。太低则图片偏离提示,太高则画面僵硬。对于需要精确控制变量的肖像,我通常设置在7-11之间。同样,九次生成需保持一致。
- 种子(Seed):这是控制“随机性”的关键。为了获得既有变化又有内在联系(如相似的脸型、骨相)的九张图,我强烈建议使用固定种子+微小变化的策略。先随机一个种子(如
12345),生成第一张满意的图作为“基底”。然后,在生成其他8张时,保持种子不变,但通过调整提示词变量来驱动变化。这样生成的人脸,会保留一种“家族相似性”,拼贴起来整体感极强。如果九张图用完全不同的种子,人脸可能千差万别,拼贴起来会像九个不同的人,失去拼贴肖像的意义。 - 分辨率:单张图的分辨率不宜过低,建议至少
512x768(竖版)或768x512(横版),以保证面部细节。同时要考虑最终网格的展示尺寸,如果最终想打印成大画幅,单张图的分辨率需要更高。
2.4 第四步:批量生成与初步筛选
在WebUI中,可以使用“文生图”下的“批次数(Batch count)”设为9,但这样是9张完全独立的图。我更推荐使用“脚本(Script)”功能中的“提示词从文件读取(Prompts from file)”。具体操作是:
- 将组合好的9组完整提示词(常量+变量)存入一个文本文件(如
prompts.txt),每组提示词占一行。 - 在WebUI中设置好模型、参数、固定种子。
- 选择脚本为“Prompts from file”,并载入你的
prompts.txt。 - 设置批次数为1,但批次数量(Batch size)可以设为1(一次生成一张),这样AI就会按顺序读取你的9行提示词,生成9张图。
生成后,你会得到9张初步成果。这时需要进行第一轮筛选,剔除那些有明显缺陷(如面部扭曲、多手指、奇怪饰品)的图。如果某一张特别失败,可能需要微调其对应的变量提示词,重新生成这一张。
3. 后期合成与精修:让九宫格成为一件完整作品
生成九张独立的优质肖像只是完成了一半。如何将它们合成一个视觉上和谐、叙事上有趣的3x3网格,是后期工作的重点。
3.1 网格布局与视觉流设计
最简单的做法是将九张图以相等的间距排列。但我们可以做得更有设计感。考虑一下视觉流的引导:
- 情绪递进:能否让九宫格的情绪从左到右、从上到下有一个流动?比如从平静到激昂,再回归平静。
- 色彩渐变:生成的九张图在色调上是否可能自然形成渐变?在后期时,可以轻微调整每张图的色相/饱和度,使其在网格中形成柔和的色彩过渡。
- 焦点变化:虽然我们固定了构图,但AI生成时细微的头部角度、眼神方向仍有差异。排列时,可以有意让所有肖像的视线指向网格中心,形成一种向心的凝聚力。
使用Photoshop、GIMP或甚至PowerPoint都可以完成拼贴。创建一个新的画布,尺寸可以是单张图宽高的3倍(如单张512x768,画布设为1536x2304)。然后使用参考线精准划分出九个格子,将图片依次置入。关键技巧:对齐时不仅要看边框,更要看“视觉重心”。有时需要轻微缩放或移动某张图,使其面部与其他格子的面部在一条水平线上,这样整体观感会更舒适。
3.2 统一化调色与瑕疵修复
即使使用了固定种子和参数,由于提示词变量不同,九张图的色调、对比度、噪点水平仍可能有细微差别。在拼贴完成后,需要对整张网格图进行全局调色:
- 色阶/曲线调整:建立一个调整图层,覆盖所有九个图层,轻微拉动曲线,确保整体的黑白场和对比度一致。
- 色彩平衡:同样通过调整图层,微调高光、中间调和阴影的色偏,使九张图的色温趋于统一。
- 瑕疵修复:放大检查每个肖像的面部。AI常见的瑕疵如奇怪的眼球反光、不自然的头发交界、皮肤上的诡异纹理,可以使用修复画笔工具或仿制图章工具进行手动修正。这一步很耗时,但对成品质感的提升是决定性的。
3.3 边框、间距与最终输出
是否加边框、边框的粗细和颜色,是影响作品最终气质的重要选择。细白边能营造现代、干净的画廊感;粗黑边则更有力量感和复古味;不加边框,让图片边缘直接对接,则更具沉浸感和整体性。间距也是如此,紧密的排列显得信息密集,宽松的排列则给人以呼吸感和精致感。
我的个人偏好是,对于写实风格,使用1-2%画布宽度的细白边或无边框;对于艺术风格强烈的,可能会尝试彩色边框或甚至不规则形状的遮罩。最后,根据输出目的(屏幕显示或打印)设置合适的分辨率和色彩模式(sRGB用于网络,CMYK用于印刷)。
4. 进阶技巧与创意延伸:突破九宫格的边界
当你掌握了基础流程后,可以尝试一些更富挑战性和艺术性的玩法,让作品脱颖而出。
4.1 动态变量与混合提示词
除了替换单个变量,还可以尝试“混合变量”。例如,提示词可以是“[emotion1:emotion2:0.5]”,这在一些支持提示词语法权重的工具中,可以生成一种介于两种情绪之间的、更微妙的表情。或者,使用“交替单词”功能,让AI在生成时随机从一组词中挑选,创造出更不可预测但又有范围限制的效果。
4.2 利用ControlNet实现极致统一
如果你追求九张图在姿势、构图上的高度统一,那么ControlNet是终极武器。具体操作是:
- 先手动绘制或生成一张你满意的肖像线稿或姿势骨架图(OpenPose)。
- 将这张图作为ControlNet的输入源,启用线稿(Canny)或姿态(OpenPose)预处理器和模型。
- 在生成其他8张图时,使用完全相同的ControlNet参考图,并保持ControlNet权重一致(如0.8-1.0)。
- 只通过改变正向提示词中的“变量”部分(如发型、服装、环境)来生成新图。
这样,你能得到九张构图、姿势、透视几乎一模一样,仅在其他元素上变化的肖像,拼贴起来会有一种强烈的形式美和韵律感,类似于安迪·沃霍尔的波普艺术重复。
4.3 从3x3到NxN:叙事序列与漫画分镜
3x3网格是一种经典形式,但并非唯一。你可以尝试2x2(更简洁)、1x3(横向叙事带)、甚至3x1(纵向变化)。更进一步的,可以将多个3x3网格组合起来,讲述一个更长的故事。例如,第一个3x3是“童年”,第二个是“青年”,第三个是“老年”,这样就构成了一幅关于时间的人生拼图。
这种形式也非常接近漫画的分镜。你可以为每个格子设计一个具体的动作或情节提示词,生成后加上对话框,就能创作出独特的AI漫画肖像故事。
4.4 融入其他媒介与实物输出
数字创作完成后,可以考虑将其带入现实世界。使用艺术微喷在油画布、水彩纸或金属板上打印,效果截然不同。我曾将一组赛博朋克风格的3x3肖像打印在亚克力板上,背光展示,科技感十足。也可以将九张图分别打印成小尺寸的照片,用实体相框在墙上拼贴,这种实体交互的体验是屏幕无法替代的。
5. 常见问题与避坑指南
在无数次尝试中,我踩过不少坑,这里总结一下最常见的问题和解决方案。
5.1 问题:九张图的脸看起来不像同一个人
- 根因分析:这是新手最容易遇到的问题,核心在于“变量”对AI生成人脸特征的影响过大,而“常量”中对人脸特征的描述又太弱或太泛。
- 解决方案:
- 强化常量描述:在常量提示词中加入更具体的人脸特征描述,例如“with symmetric face, sharp jawline, high cheekbones, green eyes”。虽然AI不一定100%遵从,但会有一个倾向性。
- 使用固定种子:如前所述,这是最重要的技巧。固定种子能锁定一个基础的“人脸潜空间向量”,变量在其上做修改,相似度会大大提高。
- 启用面部修复(Face Restoration):如CodeFormer或GFPGAN。这些后处理插件能在一定程度上将不同图片的人脸“归一化”到某种标准,提升相似度。但注意,过度修复会导致塑料感。
- 考虑使用LoRA模型:如果你有某个特定人物的多角度照片,可以训练一个该人物的LoRA模型。生成时加载这个LoRA,那么无论提示词变量如何变,生成的脸都会基于这个LoRA,相似度极高。
5.2 问题:风格或画质不统一,拼贴后显得杂乱
- 根因分析:生成参数(采样器、步数、CFG)不一致,或使用了不同版本的模型,或变量提示词中混入了影响整体风格的强效词。
- 解决方案:
- 标准化生成流程:为这个项目创建一个独立的WebUI配置预设(Preset),保存所有参数。每次生成都调用这个预设。
- 检查变量词:避免在变量中混入如“oil painting”, “sketch”这类会颠覆整体风格的词,除非你就是在做风格对比网格。变量应更多集中在内容而非基础风格上。
- 后期统一调色:如前文所述,后期全局调色是弥补生成时细微差异的必要手段。
5.3 问题:AI总是生成我不想要的元素(如怪异的首饰、背景)
- 根因分析:负面提示词不够强力或不够具体,未能有效排除这些元素。
- 解决方案:
- 强化负面提示词:通用负面词如“ugly, deformed”之外,加入更具体的描述。例如,如果不想要首饰,就加上“necklace, earrings, jewelry”。如果不想要复杂背景,加上“busy background, crowded scene”,并强化“simple background, solid color background”在正向提示词中的权重。
- 使用局部重绘(Inpainting):如果只有一两张图出现了小范围的怪异元素,可以用WebUI的局部重绘功能,圈选该区域,用简单的提示词(如“skin”, “wall”)让其重新生成该部分。
- 提示词权重调整:如果某个想要的元素不出现,或不想要的元素顽固出现,可以调整其权重。例如,想要更干净的背景,可以写“
(simple background:1.3)”,给“simple background”这个词增加权重。
5.4 问题:最终图片分辨率不够,放大后模糊
- 根因分析:直接生成高分辨率图对显存要求高且容易产生多人脸畸形。直接拉伸放大则必然模糊。
- 解决方案:
- 分步生成:先以较低分辨率(如512x768)生成满意的图像和构图。
- 使用高清修复(Hires. fix)或附加功能放大:在文生图页面下方启用高清修复,选择一个放大算法(如
R-ESRGAN 4x+或Latent),设置放大倍数(如2倍)。这会在生成完成后进行智能放大,补充细节。 - 使用专门的放大工具:生成完成后,使用像
Upscayl、Real-ESRGAN这样的独立工具进行后期放大,这些工具通常有更强大的模型和更灵活的参数。
创作AIGC 3x3网格拼贴肖像的过程,是一个在控制与失控之间寻找平衡的艺术。你设定规则,AI提供惊喜。最终的成果,既是技术工作流的产物,也是个人审美和叙事意图的体现。每一次尝试,都会让你对提示词工程、AI模型的特性和视觉叙事有更深的理解。最重要的是,享受这个“开盲盒”般的过程,当九张各具特色又和谐统一的肖像最终排列在一起时,那种创造的满足感,正是AIGC绘画最吸引人的地方。