AI 视频生成发展到现在,有一个很反直觉的现象:技术参数一年比一年漂亮,但真正决定一个片子能不能用的,往往不是分辨率,也不是渲染速度,而是三件很“笨”的事——角色能不能一直保持一致、镜头能不能连续讲完一个动作、声音能不能跟画面一起出现。Krea 上线 Wan 3.0,支持 20 张参考图与 30 秒带音频生成,恰好同时回应了这三件事里的最后两件。
先说判断:这次更新的关键词不是“更高清”,而是“更完整”。从单镜头片段到 30 秒带音频的连续内容,从一两张参考图到 20 张参考图,意味着 AI 视频生成正在从一个“素材生成器”往“短片工作台”的方向走。对普通创作者来说,真正的价值不是参数表上的数字变大,而是过去需要三四个工具、几十次抽卡才能拼出来的东西,现在有可能在一个流程里连续完成。
这篇文章不打算堆参数。我更想聊清楚几个问题:20 张参考图是不是越多越好?30 秒带音频生成到底改变了什么工作流?作为短视频创作者、内容运营或独立开发者,拿到这个能力后应该怎么用、要注意哪些坑。如果你正在纠结“AI 视频生成到底能不能用于正经项目”,这篇文章值得读完。
写作时有一个原则:文中关于 Krea 和 Wan 3.0 的信息,以公开能力和合理推断为主;涉及具体操作界面的部分,我尽量写成通用流程,避免因为版本迭代导致你对着文章找不到按钮。
1. 这篇文章真正要解决的问题
很多刚开始接触 AI 视频生成的人,最大的困惑不是“不会用”,而是“生成出来的东西没法进入生产流程”。你花了一个下午生成了一段 5 秒镜头,角色第一秒还是主角,第三秒就换了脸;第二段镜头动作倒是连贯,但画面里没有声音,剪辑时还得去素材库找音效补节奏。这些问题单独看都不大,组合在一起就变成了一个致命伤:你没法稳定地产出一条能直接发布的完整视频。
这类痛点其实可以归纳成四个问题:角色一致性差,导致多镜头叙事断裂;单次生成时长太短,导致动作和剧情被切成碎片;音频缺失或音画脱节,导致后期成本反而更高;工具链太长,从生成到粗剪要在好几个平台之间来回搬运。Krea 上线 Wan 3.0 之所以值得关注,正是因为它在“一致性、时长、音频”这三个长期短板上同时给出了一个正面回应。
那么,这篇文章到底能帮你解决什么?第一,帮你建立对“20 张参考图”和“30 秒带音频生成”这两个能力的正确预期,知道它们适合什么、不适合什么。第二,给你一套可以照做的素材准备、提示词组织、参数配置和效果验证流程。第三,把常见的翻车场景提前列出来,让你少走弯路。文章不承诺你看完就能做出大片,但至少能让你在动手之前,把关键决策想清楚。
什么样的读者最应该读?如果你是短视频创作者,想用 AI 生成连续叙事镜头;如果你是内容运营,需要批量产出带人物设定和配音的素材;如果你是独立开发者,在评估自建视频生成工作流;或者你是产品经理,需要理解 AI 视频工具的能力边界——这篇文章都适合你。如果你只是想随便试一下生成特效,那也可以看,但不需要把每个章节都读完。
2. 基础概念:Krea、Wan 3.0 与 AI 视频生成链路
2.1 Krea 是什么
Krea 是一款面向创作者和设计师的 AI 创意工具。它最早的定位偏图像生成和实时创意探索,用户可以通过界面直接生成插画、海报、概念图,在设计师和内容创作者群体里积累了不少口碑。与很多纯模型厂商不同,Krea 更强调把底层模型包装成“顺手的产品”,让用户不需要理解模型训练、采样器、提示词工程这些复杂概念,也能完成一张图或一段视频的创作。
从这次更新的方向看,Krea 的产品思路很清晰:它不是在堆一个更强的模型,而是把更强的模型接到自己的创作工作流里。Wan 3.0 作为底层视频生成能力,被接入了 Krea 的界面和流程中,用户可以在熟悉的创作环境里使用新的生成能力。对于普通用户来说,这意味着学习成本被大大降低了。
2.2 Wan 3.0 是什么
Wan 是视频生成模型系列的名字。从公开信息来看,这个系列在这两年 AI 视频生成热潮中逐渐进入开发者视野,它以生成质量高、可控性强为主要卖点。Wan 3.0 就是这一系列的新版本。标题里提到的两个能力——20 张参考图输入和 30 秒带音频生成——是在这一版本中集中体现出来的核心升级。
需要强调的是,我这里不会给 Wan 3.0 编造参数表和训练细节,因为这个信息需要以官方发布为准。但从能力描述可以判断,Wan 3.0 的升级重点有两个方向:一是条件控制能力更强,参考图从个位数增加到 20 张,意味着模型能接收更丰富的视觉约束;二是生成长度和模态覆盖面提升,30 秒带音频生成说明模型不仅输出视频帧,还能同步预测和生成对应音频。
2.3 一次 AI 视频生成的完整链路
要理解这次更新为什么重要,得先看一条完整的 AI 视频生成链路。通常一个工具的内部工作流是这样的:用户输入提示词(文本描述)或参考图(视觉条件),模型把这些条件编码成向量,然后在潜在空间里逐步生成连续的视频帧,最后解码导出画面;如果模型还带音频能力,还需要在视频帧的基础上生成对应的声音信号。
前几年的大部分视频生成工具,只能接收“一段文字”作为条件输入,所以角色长什么样、穿什么衣服、环境是什么气氛,全靠模型从训练数据里“猜”。后来开始支持首尾帧,用户给一张起始画面和一张结束画面,模型负责补中间过程。再往后发展到多参考图输入,用户可以提供角色的正面、侧面、服装细节、道具、场景环境等多张图片,让模型在生成时建立更完整的视觉档案。这次的 20 张参考图,就是沿着这条线继续往前走。
2.4 这次更新在能力坐标系里的位置
可以用一个简单的表格来理解这次更新的位置。注意,这个表格描述的是 AI 视频生成能力的通用演进方向,不代表对具体产品的横向对比:
| 能力维度 | 早期方案 | 常见方案 | 这次更新的落点 |
|---|---|---|---|
| 角色一致性 | 靠提示词描述 | 1-2 张参考图 | 最多 20 张参考图 |
| 单次生成时长 | 3-5 秒 | 10 秒左右 | 30 秒 |
| 音频生成 | 后期手动配音 | 部分工具支持音效 | 30 秒视频带音频 |
| 工作流完整度 | 单镜头片段 | 多镜头拼剪 | 单个生成流程内连续叙事 |
从这张表可以看出,这次更新把 AI 视频生成从“片段级”往“场景级”推了一步。过去 30 秒的视频需要拆成五六个片段分别生成再剪辑,现在如果单次生成就能达到 30 秒且带音频,前期素材的完整度会明显提升。
3. 核心能力拆解:20 张参考图与一致性控制
3.1 参考图数量多,不等于“随便堆图”
很多人看到“支持 20 张参考图”的第一反应是:那我传 20 张图,模型是不是就能生成一个极其精确的角色?这个理解并不完全正确。参考图的作用是给模型提供视觉约束,约束越多,模型对主体的理解越具体,但从另一个角度看,约束越多也意味着信息冗余和冲突的可能性越大。
一张合格的参考图,应该对应一个明确的维度:正面脸、侧面脸、背面视角、半身服装、全身比例、局部特写、常用道具、典型场景。如果 20 张图全部是同一个角度的自拍,模型只会记住“这个人从正面看起来什么样”,一旦镜头转到侧面,角色照样会崩。参考图管理的核心逻辑,是按“视觉档案”的方式组织信息,而不是按数量堆图。
3.2 20 张参考图适合哪些创作场景
20 张图的容量,放在真实生产里其实是很有讲究的。第一种场景是角色 IP 类创作,你需要一个原创角色在多集短视频里以稳定形象出现,那么把角色在不同角度、不同服装、不同表情下的照片全部喂给模型,就能建立一套相对完整的角色视觉库。第二种场景是广告和电商短片,产品往往有固定包装、标志、材质细节,一张图根本说不完,多张参考图可以分别约束产品外观、包装、使用场景和人物模特。第三种场景是连续叙事,你要生成一个短片的多个镜头,每个镜头里主角必须长得一样、衣服一样、环境一样,20 张参考图可以同时覆盖角色和场景两个维度。
如果你只是生成一个氛围感空镜、一段抽象粒子特效,或者一个没有主体连续性的转场片段,那么 20 张参考图几乎没有意义,用 1 张甚至 0 张参考图效果反而更自由。不要为了用满 20 张而去堆图,这是新手最容易犯的错误。
3.3 怎么组织参考图才有效
参考图不是随机选出来的,而是应该按信息维度筛选。我建议你在上传前先做一轮“去重和补缺”:第一步,确认主体的标准外观,至少要有正面、侧面、背面三个角度的清晰图;第二步,补充关键细节,比如角色的发型、配饰、服装纹理,产品的 Logo、标签、包装材质;第三步,加上场景环境参考图,让模型知道主体应该在什么样的空间里出现;第四步,检查光线和画风,保证参考图之间的色调不要互相打架。如果参考图之间风格差异过大,模型会试图“平均”这些信息,结果往往是每个特征都有一点,但整体不协调。
这一步其实很像传统影视项目里的“角色设定图册”。在动画和电影制作中,角色设定图会从多个角度画同一个角色,标注服装、道具、表情和常用动作,AI 视频生成的参考图体系正在复刻这套思路。你越早建立这种资产意识,越能发挥多参考图的价值。
3.4 最容易翻车的地方在哪里
新功能往往伴随新坑。多参考图模式最常见的问题是“过拟合”:当参考图太多、重叠信息太密集时,模型会过度关注细节,反而让画面显得僵硬,角色动作幅度变小,镜头运动变得保守。第二个常见问题是“风格冲突”,参考图里如果既有写实照片又有动漫插画,模型会不知道怎么统一样式。第三个问题是“提示词被稀释”,有 20 张图做约束后,文本提示词的作用空间会被压缩,如果你还在提示词里写了一大段具体描述,反而容易出现文本和图像打架的情况。
稳妥的做法是:参考图负责锁住“谁、长什么样、在哪里”,提示词负责描述“在做什么、怎么运动、什么情绪”。两者分工明确,冲突就会少很多。
4. 30 秒带音频生成:从“会动”到“能讲”
4.1 30 秒的单次生成意味着什么
在 AI 视频生成领域,单次生成的时长直接决定了创作单元的大小。早期工具一次只能生成三五秒,创作者只能按“镜头”来规划素材;后来提升到十秒左右,可以完成一个简单动作;到了 30 秒这个量级,单次生成已经足够承载一个完整的小场景了——一个角色走进房间、坐下、说出第一句台词、镜头顺着动作和声音推进,这个连续过程在结构上已经接近一个短视频的最小叙事单元。
30 秒的难点不只是把画面变长,而是长时间内的动作连贯性、空间一致性和光影稳定性。很多模型生成短片段时看不出问题,一旦生成时间变长,会出现物体漂移、人物变形、背景闪烁等毛病。因此,30 秒的单次生成能力,本质上是模型在时序一致性、运动建模和场景保持上的一次整体升级。
4.2 带音频生成解决了什么难题
“带音频生成”这四个字,信息量非常大。过去的 AI 视频工具主要输出无声视频,声音要靠创作者在剪辑软件里另配音效、配乐和口播。这一方面增加了工作量,另一方面也造成了音画节奏很难对齐。带音频生成意味着模型在生成视频帧的同时,会同步预测画面中最可能出现的环境音、动作音甚至对白,直接输出音画同步的素材。
真正稳定的带音频生成,需要模型理解画面中的因果关系:人物开口说话,嘴型应该和语音内容对应;雨天下雨,视频里应该有持续的雨声和偶尔的雷声;物体碰撞,音效应该出现在碰撞发生的瞬间。这些能力在技术上比单纯生成视频帧更复杂,因为它要同时建立视觉特征和音频特征的映射。如果这个能力做得足够好,创作者可以省掉一整条“配音+找素材+手动对齐”的传统流程。
4.3 适合与不适合用带音频生成的场景
最适合带音频生成的场景,是那些“音画关系明确”的内容:产品使用视频中的按键声、开合声、提示音;短剧中的环境氛围音和人物对话;户外拍摄类的风声、脚步声、车流声;解说类短视频里的语气和节奏。这些都是声音在叙事中占据重要位置的类型。
反过来,也不是所有内容都需要生成音频。比如背景音乐类的氛围视频,你可能更希望得到干净的无声素材,方便后期自己配音乐;或者需要多种语言配音的国际化内容,仍然要回到后期配音流程。理解工具的适用边界,比理解工具的强大之处更重要,这能帮你判断一个功能到底应该被用在流程的哪个环节。
5. 素材准备与实操流程
5.1 基础条件与前置准备
开始实操之前,有几个基础条件需要确认。首先是账号和平台访问,Krea 需要通过官方渠道注册登录,具体以你所在网络环境的实际情况为准。其次是浏览器建议使用较新版本的 Chrome 或 Edge,AI 生图工具通常对浏览器的 WebGL 和后端上传能力有一定要求,老旧的浏览器容易出现上传失败或预览卡顿。
然后是素材。如果你打算用 20 张参考图的能力,先不要急着打开生成界面,建议先建一个本地素材文件夹,把参考图统一整理好。这一步非常重要,因为在界面上传图时,你还需要为每张图考虑它在整个视觉档案中的位置。
5.2 参考图素材清单
参考图应该覆盖哪些维度?下面这张清单可以直接作为你的检查表。数量建议是一个经验值,不是硬性要求,实际项目中你可以根据主体复杂度调整:
| 素材类型 | 数量建议 | 作用 | 常见问题 |
|---|---|---|---|
| 正面清晰照 | 2-3 张 | 锁定主体正面外观 | 模糊、逆光 |
| 侧面照 | 2-3 张 | 保证转侧脸不变形 | 数量不足 |
| 背面照 | 1-2 张 | 保证转身镜头稳定 | 被忽视 |
| 服装/局部细节 | 3-5 张 | 锁定材质、纹样、配饰 | 和主体图风格冲突 |
| 道具/标志 | 2-3 张 | 产品专属细节 | 占比过小 |
| 场景环境 | 3-4 张 | 锁定发生地点和气氛 | 色调不一致 |
| 参考画风 | 2-3 张 | 统一美术风格 | 风格互相打架 |
5.3 本地素材目录结构示例
推荐使用下面的目录结构组织素材,命名尽量语义化,方便后续批量处理:
project/ ├── 00_prompt/ │ ├── prompt_v1.txt │ └── prompt_v2.txt ├── 01_character/ │ ├── front_01.png │ ├── front_02.png │ ├── side_01.png │ ├── back_01.png │ └── costume_01.png ├── 02_props/ │ ├── logo.png │ ├── package_01.png │ └── detail_01.png ├── 03_scene/ │ ├── room_01.png │ ├── room_02.png │ └── outdoor_01.png └── 04_style/ ├── style_01.png └── style_02.png这样组织的好处有两个:第一,上传时你能快速知道每一张图承担什么任务;第二,如果某一批生成结果在角色一致性问题翻车,你能快速定位是“正面身体资料不够”还是“场景图干扰了主体”。
5.4 提示词模板示例
提示词不建议写太长,重点是“动作 + 镜头 + 情绪 + 环境动态”,把长相和服装交给参考图。下面是一个通用模板,你可以根据自己的项目调整:
[主体]在[场景]中[做动作], 镜头从[起始景别]缓慢推进到[结束景别], 光线[光线描述],整体氛围[情绪词], 画面带真实的环境音:[具体声音描述]。示例:
一个穿黑色风衣的女性角色在旧城区街道上冒雨前行, 镜头从全景缓慢推近到半身, 路灯在潮湿路面形成倒影, 整体氛围压抑而紧张, 画面带清晰的雨声和远处的车流声。这个示例里,角色外观、服装、街道环境都靠参考图提供,提示词只负责描述动作、镜头和声音。你把两者拆开之后,生成结果的确定性和可复现性都会提升。
6. 接入方式与参数配置示例
6.1 界面操作思路
不同版本的 Krea 界面可能有差异,但操作逻辑通常是通的:先选择模型版本,确认当前使用的是 Wan 3.0;再进入参考图上传区域,按刚才整理好的目录顺序上传图片;接着在提示词输入框里填写动作和镜头描述;最后设置生成参数,包括时长、画幅比例、音频开关等。
如果你第一次用,建议先用一两个最简单的案例跑通,不要一上来就上传 20 张图。先用 3 张参考图确认“正面、侧面、场景”三个维度的效果,再逐步增加。这个过程看起来慢,实际上能帮你快速理解这个版本的模型对参考图的敏感程度。
6.2 参数配置 JSON 示意
下面是一个参数配置的示意结构,主要用于描述生成请求里可能需要调整的字段。注意,这不是 Krea 官方 API 文档,不同平台的字段名会有差异,请以实际页面的展示为准。
{ "model": "wan-3.0", "task_type": "text_to_video", "reference_images": [ "character/front_01.png", "character/side_01.png", "character/back_01.png", "scene/room_01.png" ], "prompt": "一个穿黑色风衣的女性角色在旧城区街道上冒雨前行,镜头从全景缓慢推近到半身,画面带清晰的雨声和远处的车流声。", "duration_seconds": 30, "aspect_ratio": "16:9", "audio_enabled": true, "seed": 1024 }重点理解几个字段:reference_images是你提供的参考图列表;duration_seconds控制生成时长,这里演示的是 30 秒;audio_enabled控制是否生成音频;seed是随机种子,固定种子可以让你在