Wan 3.0电商视频实战:图片、视频、声音参考怎么配合
2026/9/24 20:26:06 网站建设 项目流程

做电商视频的朋友应该都有过这种体验:素材库里商品图、实拍片段、早期录好的口播旁白全都齐了,可真拿 Wan 3.0 这类 AIGC 工具生成一条 30 秒商品视频时,反而不知道该把哪些素材喂给模型。图片参考要传几张?视频参考是给全部还是给片段?声音参考到底影响画面哪里?全都一股脑拖进去,生成结果经常四不像。

这篇文章不聊理论,就讲实际干活时的分工思路。我会用“多张图、视频参考、声音参考”三种输入同时使用时的组合逻辑,配合一条 30 秒商品视频的完整制作流程,拆开来说清楚每一种参考在什么时候用、用多少、怎么配合提示词。适合正在做电商详情页视频、信息流广告、抖音商品卡内容的运营同学,以及所有想用 AI 视频工具提效的创作者。

1. 先搞清楚三种参考到底在控制什么

1.1 图片参考:给商品“画脸”

先把一个基本概念说清楚:Wan 3.0 这类模型接收图片参考,不是把图片直接贴进视频,而是从图片里提取视觉要素——商品主体轮廓、颜色、材质、光影关系、构图方式、背景环境。换句话说,图片参考决定了视频每一帧“长什么样”,角色是“定基准”。

如果你只传一张商品图,模型会默认以这张图的整体视觉为主体;如果你传多张,模型需要在多张之间做信息融合,这时候就轮到我们给它排优先级了。我在实际使用中,最稳的做法是第 1 张放“主视觉图”,也就是这条视频里最想让观众记住的形态,比如产品 45 度角展示图;后面再放 1 到 2 张细节补充图,比如材质特写、使用场景、包装字体。数量上尽量控制在 4 张以内,超过这个量,模型容易把不同图的元素交叉混合,最典型的表现就是产品轮廓变了、logo 位置飘了、背景颜色掺在一起。

还有一个很容易被忽略的细节:参考图的背景比产品本身更影响画面氛围。如果主图是干净白色背景,细节图却选了暖黄色台灯场景,模型生成出来的画面大概率会把两种环境光做混合,出来的色调既不像白天也不像黄昏。所以图片参考之间要尽量保持统一的色温和背景逻辑,至少要保证主图和前两张补充图“看起来像同一个影棚里拍的”。

1.2 视频参考:给镜头“写动作”

视频参考解决的不是画面内容,而是“运动”。模型会分析参考视频里的镜头运动方向、主体动作幅度、转场速度、景别变化模式,然后把这些运动特征应用到新的画面生成中。

这也是很多人踩坑的地方:以为传一段商品实际拍摄视频,模型就会照着生成同一款商品。其实参考视频更像一份“动作底稿”,模型提取的关键是运动轨迹而不是画面内容。比如你传一段相机围绕产品缓缓推进的实拍视频,Wan 3.0 会学着用这种“环绕推进+焦点固定”的方式去运镜,但画面里的产品样式来自图片参考。所以工作流上建议把视频参考当成“镜头动作库”来用,专门负责告诉模型:这一段怎么转、怎么看、怎么切换景别。

准备视频参考时,尽量截取 5 到 10 秒、画面无跳剪、运动轨迹连贯的片段。我常用的几类动作库包括:产品旋转展示、镜头推进与拉远、液体倾倒、布料飘动、光照变化。每类视频对应不同的商品表现——卖咖啡机,我会截一段豆仓转动或咖啡液流入杯中的视频;卖服饰,我会截一段同材质布料自然摆动的视频。要特别提醒的是,参考视频里如果有非常明显的环境噪音,比如风声、人声、电流声,也可能会干扰模型对音频信号的理解,最好在导入前把参考视频静音处理。

1.3 声音参考:给视频“定情绪”

声音参考是目前很多用户还没充分利用的功能。Wan 3.0 在生成视频时支持原生音频输出,声音参考的作用就是让模型知道:这段视频的音频风格、语速、情绪、音乐节奏应该参考哪条素材。

打个比方,图片参考是“模特定妆照”,视频参考是“走位路线图”,声音参考就是“背景乐谱和台词提示卡”。如果一条 30 秒商品视频的定位是“高级感冷淡风”,那声音参考最好是语速偏慢、间隔明显的口播,或者节奏舒缓的音乐;如果定位是“带货冲动消费”,声音参考就要找语速快、重音多、BGM 鼓点清晰的素材。模型会根据声音参考的情绪强度,反过来约束画面的镜头切换速度——这点很多人没意识到。

实际操作中,声音参考还可以帮助对齐画面节奏。我会把声音参考里的重音位置和关键停顿标出来,再在提示词里写明“声音在第 X 秒出现重音时,画面切换为产品细节特写”,这种音画同步的效果远好于单纯依赖模型随机生成音频。后面第 3.4 节我会专门讲怎么“卡点式”嵌入声音参考。

2. 动手前先把素材盘明白

2.1 图片素材的分拣、命名与色彩统一

我自己的习惯是先在本地建一个临时文件夹,把这条视频可能用到的所有图片丢进去,然后按“使用优先级”重新命名。推荐的排序规则是:

  • 01_主视觉:产品整体外观图,画面干净,最好没有复杂背景
  • 02_细节特征:产品质感、纹理、按键、材质特写
  • 03_使用场景:产品在实际使用中的照片,带人的效果更好
  • 04_包装文案:需要展示的品牌 logo、包装盒、卖点文字

这个顺序有两个隐藏作用。第一,第 1 张图决定了主画面的第一印象,模型默认会对前序图片分配更高融合权重;第二,后续图片是补充线索,模型在生成每个镜头时会在提示词的引导下,从这些参考图里提取对应元素。

图片分辨率也是个变量。如果参考图太小,比如只有 480p,模型会强行放大再提特征,出来的商品细节经常糊成一团;但太高的分辨率又可能让模型过度纠结图片里的噪点和瑕疵。我建议参考图统一处理到适合生成模型的输入分辨率附近,比例保持 1:1 或者 4:3 都行。至于格式,JPG 和 PNG 都能用,但不要用带透明通道的 PNG——透明区域在融合时经常变成灰色色块,处理起来很麻烦。

最后检查一遍:所有参考图里不要出现和商品无关的显著文字、水印、二维码。这些元素会被模型当成画面内容生成出来,非常难修。曾经有一张参考图右下角带了一个很小的摄影工作室水印,生成出来的视频里,水印被放大成了背景里的“品牌logo”,删都删不掉。

2.2 参考视频的截取、静音与动作取样

参考视频不是越长越好。过长的视频会引入太多无关运动,模型难以判断到底要学哪个动作。我建议截取 5 到 10 秒,并且只保留单一运动逻辑的片段。

什么叫单一运动逻辑?就是这一段里镜头或主体只做一件事:要么是旋转,要么是推进,要么是平移,别一会推近一会拉远再横摇。视频参考最大的作用是提供“干净的动作样本”,动作越纯净,生成视频的运镜越可控。

预处理时我一般做三件事。第一,把视频裁剪到只保留主体区域,去掉无关的背景杂物;第二,把音轨静音导出,避免环境音干扰模型对声音参考的判断;第三,如果原视频有镜头抖动,先做一次轻度稳定处理,不然模型会把“抖动”当成本次风格,生成结果全是微晃镜头。

如果模型支持视频参考的权重参数,我一般设置在中高。理由是这样既能保留参考视频的运镜习惯,又不会让生成结果完全照抄原视频的画面构图。

2.3 声音参考的类型、时长与格式预处理

声音参考分成两类:一类是口播旁白,一类是纯 BGM。两类在生成时都建议控制在 15 秒以内,太长的音频会让模型抓不住重点。

口播旁白参考,我会提前剪出“完整的一句话”作为参考,比如“每天一杯,唤醒全天”,语速、重音、情绪都要典型。不要给一段读得很平淡的素材,模型学出来就是平调。如果手里没有合适的口播素材,也可以用 TTS 先合成一版“标准语气”作参考,虽然音色不一定最终使用,但情绪轮廓是准的。

纯 BGM 参考,重点关注节奏和重音。你不需要懂音乐理论,只要听出一首曲子大概每分钟多少拍、重音在哪、有没有明显的情绪起伏。更实用的是在本地剪辑工具里把音频波形打开,看一眼重音之间的大致间隔,然后把这个节奏信息写进提示词。

格式上,我建议用 WAV 或者高码率 MP3,采样率不用追求极限,16bit/44.1kHz 就够用,但声音不能过载发闷。如果有条件,把声音参考以“前 0.5 秒静音+正式内容+后 0.5 秒静音”的形式导出,方便模型分辨声音起点和终点。

3. 30 秒商品视频的实操分工方案

3.1 先写一条“三段式”分镜脚本

30 秒不算长,但按照观看逻辑仍然可以拆成三段:前段建立认知,中段展示细节,末段引导转化。我在写提示词之前,一定会先在文档里把这三段写清楚,否则参考资料一多,模型很容易在各个参考之间“反复横跳”。

假设这个商品是一款便携咖啡机,我的 30 秒脚本大概是:

时间段画面内容镜头设计主要参考资料
0-10 秒白色桌面背景,咖啡机从正面缓缓旋转半圈,随后镜头缓慢推进旋转 + 推近01_主视觉图 + 产品旋转视频
11-22 秒切换至细节特写,萃取口流出咖啡液,按键指示灯亮起,水箱装配过程侧上方 45 度俯拍02_细节图 + 液体流动视频
23-30 秒镜头拉远,咖啡机回到全景,旁边放上一杯成品咖啡,灯光渐暖,配合口播拉远 + 定帧01_主视觉图 + 声音参考口播

这三段里,每一段都被分配了“主角参考”。第一段的主角是主视觉图加旋转动作视频参考;第二段的主角是细节图加液体流动类视频参考;第三段又回到主视觉图,加上声音参考里的口播情绪。这样分工,每一种参考资料都在有限的时间里各管一段,不会互相打架。

3.2 分段投放参考图与提示词配置

在实际操作时,我会把图片参考、视频参考、声音参考一起上传,然后在提示词里明确指定每段使用哪张参考图、采用什么镜头动作。Wan 3.0 对提示词中的“第一张参考图”“第二张参考图”这类表述通常有较好的理解,你可以写“第一张图中的产品”“第二张图中的特写细节”来指代。

给一个可以直接参考的提示词模板:

第 1 段提示词:

“以第一张参考图中的产品外观为准,白色桌面干净背景,镜头从正面缓慢顺时针旋转约 90 度,随后缓慢推近,画面焦点始终在咖啡机机身,画面内不要出现其他无关物品,时长约 8 秒。”

第 2 段提示词:

“画面切换到第三张参考图中的使用场景,镜头从侧上方 45 度俯拍,咖啡液从萃取口落入杯中,水流速度中等,注意保持产品主体颜色与第一张参考图一致,持续约 10 秒。”

第 3 段提示词:

“镜头缓慢拉远,回到第一张参考图的整体视角,桌面上出现一杯成品咖啡,暖色灯光,画面自然结束,保留空间给口播文案,时长约 8 秒。”

这里有个关键技巧:每段提示词里都要提到“参考图”,但不用把所有参考图都写进去。比如第二段只用第三张场景图和液体流动视频参考,就不要在提示词里提“第二张细节图”,否则模型会把不相关的细节也强行加进来。给模型做“减法”,比做“加法”更容易得到干净画面。

3.3 生成参数与权重怎么搭配

运行前把分段提示词分别填入,如果工具支持一次生成多段再拼接,可以分段生成后统一剪辑;如果不支持,就按镜头粒度多次生成,最后用剪辑工具合成。这里说一下我常用的参数区间,你以自己所用版本的选项为准:

参数我的常用值说明
分辨率1080P保证后期裁剪空间,不要低于 720P
帧率24-30fps商品视频 24 帧即可,30 帧更顺滑
时长5-10 秒/段3 段合成 30 秒,逐段控制
图片参考数量2-4 张超过 4 张容易串味
视频参考时长5-10 秒单一运动逻辑
视频参考权重中高保留运镜但不照抄画面
声音参考时长12-18 秒留出静音尾巴

提示:不是所有界面都支持把同一段视频分段生成,如果你的工具不支持分段提示词,就按 5 秒左右的镜头为单位多次生成,再通过剪辑合成 30 秒。这样可控性更高,也方便逐段筛选最满意的一条。

3.4 声音参考的“卡点式”嵌入

把声音参考当作一条时间轴来管理。我实际操作时会在声音参考里找到三个关键时间点:开场 BGM 进入点、中间节奏重音点、结尾口播结束点。然后把这几个点换算成视频时间,写在每一段的提示词里。

比如声音参考的 BGM 在第 4 秒出现重音,那么第 1 段提示词可以写成“第 4 秒左右完成旋转,画面随节奏切换到特写”。不要小看这个细节,音画同步是最能提升“高级感”的一环,很多 AI 生成的视频刚出来时画面好看却总觉得“说不上来的怪”,多半就是声音和画面各走各的。

如果工具支持关闭原生音频,建议先关闭生成时自带的 BGM,只保留提示词的节奏引导,然后在后期剪辑时把真正的声音参考素材对准卡点位置放上去。这个做法可以避免模型又生成画面又生成音频导致的声音混乱,尤其在声音参考是人声口播的时候,模型自动生成的音乐经常会跟口播打架。

4. 生成时的常见问题与排查技巧

4.1 多图参考后产品“串味”

现象:给了 4 张图,生成视频里的产品既不像第 1 张也不像第 2 张,变成一个四不像。

排查思路:先把参考图减到 2 到 3 张,只保留主视觉和一张细节图,看问题是否消失。如果消失了,就是参考图过多导致模型自主融合;如果没消失,再检查是不是背景色调差距过大。另外一个高频原因是产品图本身带了水印或背景文字,模型把文字当成商品的一部分生成出来,这个前面已经说过。参考图里尽量用去水印、纯背景的素材。

4.2 视频参考动作与预期不符

现象:上传了“产品旋转”参考视频,生成结果却是画面卡顿或者镜头乱动。

原因多半是参考视频里主体不够居中、背景环境复杂,模型学着学着就把无关动作也学进去了。解决方法是换一段目标单一、背景干净的动作视频,或者把参考视频的运动方向写进提示词,比如“自右向左水平旋转”“镜头匀速推进”。还有一个小技巧:把参考视频的画面裁剪到只保留产品区域,模型能更聚焦地提取运动。

如果生成结果出现明显的镜头抖动,优先检查参考视频是不是手持拍摄、没有稳定处理。模型会认为“抖动”是这个运镜的一部分,生成时就给你复刻出来。解决办法是换稳定器拍摄的参考视频,或者先对参考视频做运动稳定再喂给模型。

4.3 声音与画面各走各的

现象:旁白说了三句话,画面在第二句时就已经结束;或者 BGM 重音和转场对不上。

我排查的第一步是检查声音参考时长和视频总时长是否匹配。声音参考超过 30 秒,模型很容易在视频后半段丢失节奏;声音参考太短,视频后半段就变成无声的“哑剧”。建议声音素材控制在 12 到 18 秒,留出足够的静音尾巴。第二步是在提示词里明确写出卡点时间,比如“第 6 秒转场”“第 12 秒特写”,让模型按时间轴执行。

还有一种情况:声音参考里人声和 BGM 混在一起,模型分不清主次,生成的音频里人声特别小、BGM 特别大。这时可以把声音参考拆成两条——一条纯人声口播、一条纯 BGM,分别上传,再在提示词里写明“人声为主,背景音乐约 30% 音量”,效果会好很多。

4.4 商品文字和 logo 生成乱码

Wan 3.0 对文字生成已经比早期模型强很多,但遇到产品名、标语这类精确文字仍然可能输出错误字符。不要指望它一次生成完美,稳妥做法是:图片参考里给一张干净的 logo 图,提示词里写“保留第一张图中的 logo 不改变”,生成后在剪辑工具里重新叠加产品名文字层。

注意:如果视频里有大段卖点文案,宁可在剪辑阶段用字幕方式加大,也别让模型在画面里直接生成长句。画面内文字越短,成功率越高,比如单个产品名或一句四个字的品牌 slogan 可以尝试直出,超过 10 个字的文案建议后期叠加。

4.5 反复失败时的排查顺序

我一般按照“图片参考 -> 视频参考 -> 声音参考 -> 提示词”的顺序逐个调整,一次只改一个变量。先换主图,看主体是否稳定;再换动作视频,看运镜是否流畅;再换声音参考,看节奏是否同步;最后才调提示词措辞。千万不要因为一次失败就把所有参考资料全换掉,那样根本定位不了问题。

记录一下每次生成时的“参数组合”也很有用。我习惯给每次生成起一个简单编号,比如“coffee_v1_4img_rot_ref_bgm”,下次翻看历史记录就知道哪次用的什么配置,避免重复试错。

5. 从生成到成品:一条能直接上架的 30 秒视频

5.1 生成后的二次剪辑补全

模型生成的结果很少能直接当最终交付物。我会把生成的多段片段导入剪辑工具,先做粗剪,把最顺眼的镜头连起来;然后叠加字幕、品牌 logo、卖点贴纸;最后把声音参考里的口播和 BGM 对准时间线重新铺上。

这里有一个细节:AI 生成的画面如果有一段特别喜欢但声音不好,可以单独把画面片段剪出来,把音频替换成干净的声音参考素材,不必所有内容都靠模型一次完成。把模型当成“画面生成器”,把剪辑台当成“最终合成器”,效率反而更高。

另外,生成视频的收尾经常会有“突然结束”的感觉,这是因为模型对结尾动作的约束不够。在剪辑时我会给最后一段加一个 5 到 10 帧的落幅停留,或者在末尾叠一层品牌 logo 渐隐,让视频结束得干净利落,而不是硬生生掐断。

5.2 交付前要做的平台适配与画质检查

不同电商平台的商品视频尺寸和时长要求不太一样,比如淘宝主图视频常用 1:1 方形,抖音带货视频常用 9:16 竖版,信息流广告可能又需要 16:9 横版。生成前想清楚你这条视频主要是给哪个渠道用,再决定生成长宽比。

关于文件大小和码率,主流平台对视频大小有限制,导出时建议用 H.264 编码、分辨率不超过 2K、码率控制在 8Mbps 以内,兼顾清晰度和上传速度。时长控制在 30 秒左右,最长不要超过 35 秒,否则完播率会明显下降。前 3 秒一定要出现商品本体或者明确卖点,用户手指一划就走,不能指望他等 5 秒才看到商品。

最后,交付前最好用手机预览一遍,检查字体大小在移动端是否清晰、声音参考的 BGM 有没有压过人声、画面颜色是否过曝。还有一个我很在意的小事:视频里的商品方向一定要跟详情页里的主图保持一致,比如详情页里产品拉环在左边,视频里却在右边,用户会下意识觉得“这不是同一个商品”。

我个人在实际操作里的体会是:Wan 3.0 做商品视频,最大的变化不是生成质量提升,而是工作习惯被改过来了。以前做一条 30 秒视频,先找素材、再写脚本、再找配音、再剪辑,一条条线性推进;现在反而是先把参考资料分好类、标好优先级,让模型一次性给出几版粗胚,再从中挑胚子打磨。图片参考、视频参考、声音参考,哪个优先级高,哪个就该在提示词里被点名,而不是让模型自己去猜。如果你也想上手试,建议先拿一个商品把“三段式脚本 + 三类参考”跑通一遍,跑完之后你自然会摸到每种素材的脾气。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询