你是不是也被流量和内容困住了:一款 SaaS 产品今天要发版,明天要发短视频,月底还要做一场 AI 工具发布会,需要在几十秒内把 ChatGPT、Claude、豆包、DeepSeek、可灵、即梦、Kimi 这些产品用“照片墙”或“背景墙”的形式集中展示出来。文案要怎么写得快?视觉素材从哪来?最后怎么套进 AE 模板剪辑成片?如果你正在做这种项目,大概率会发现,瓶颈不在单个 AI 模型有多聪明,而在于你有没有把多个 AI 放进一条可执行的流水线。
这篇文章给出一个更稳的判断:与其一份一份去问“ChatGPT 怎么帮我写文案”“可灵怎么帮我生成视频”,不如把整个制作过程当成一个“多 Agent 协作工坊”来设计。文案、字幕、视觉提示、素材校正、模板渲染,每个环节由不同的 AI 服务承担,最后统一收口到 AE 模板和背景墙版式里。读完你可以照着搭建一套从提示词、脚本到导出成片的完整流程,并且知道哪些坑一定要躲。
我不会假装自己跑到每个产品里做了完整的实测,下面所有流程、提示词和工程建议都来自与这类素材制作项目相伴的常见做法,你可以用一个最小样片先跑通路线,再逐步扩展到真实品牌物料。毕竟 AI 工具更新的速度太快,方法论比某个单一按钮更值得先沉淀下来。
1. 这篇文章真正要解决的问题
做 SaaS 产品的宣传视频,和做普通短视频有个显著区别:你必须有“产品在场感”。特别是 AI 工具介绍类视频,观众要在很短时间里看到这个产品长什么样、界面是什么风格、它能处理什么类型的内容。于是就有了“背景墙”或“照片墙”这种版式需求——把多个 AI 产品的主视觉、截图、对话界面、生成结果摆到同一个画面上,配合科技感流动背景,形成一种“整个 AI 生态都在这里”的视觉印象。
传统做法分成四步:先找策划写脚本,再找设计师做视觉,接着让剪辑师把它剪成片子,最后逐帧校对字幕和文案。听起来简单,实际执行时会出现三类典型问题:
第一,多工具素材不一致。今天找到一个模型生成的画面,明天换一个工具生成另一段素材,风格、比例、语气全都不一样,拼在一起非常像“AI 缝合怪”。
第二,文案和视觉脱钩。文案组写好了旁白,视觉组根本不看文案,生成出来的画面跟字幕对不上,或者视频镜头承载不了文案信息。
第三,AE 模板变成了最后才考虑的环节。很多人先让 AI 生成一堆素材,再去找模板硬套,结果模板的占位图层尺寸、数量、文字长度都跟素材不匹配,前期省下的时间全在后期浪费掉。
所以这篇文章真正要解决的不是“某个模型怎么用”,而是如何把多个 AI 工具、一份 AE 模板、一个照片墙版式串成一条分工明确的生产流水线。适合的读者包括:SaaS 创业者、技术产品经理、企业里负责产品推广的开发同学、以及所有想提高技术内容制作效率的内容运营。
如果你只想找“哪款 AI 生成海报最方便”,这篇不是你的菜;如果你想在下一次项目里做到“文案自动变分镜、分镜自动变提示词、素材自动进模板”,下面这套思路可以直接抄走。
2. 四个关键概念先说清楚
在进入操作之前,先统一一下术语,避免后续看到“Agent”“AE 模板”“照片墙”被绕晕。
2.1 多 AI 协作不是“开很多网页切换”
多 AI 协作,指的是让不同的 AI 服务分别在流水线里承担固定角色:A 负责产文案,B 负责把文案转成视觉提示,C 负责翻译或校对字幕,D 负责最终质量检查。它们之间不能只是“你我各生成一份,最后拼起来”,而是要让前一步的输出格式约束住后一步的输入。
一个比较通用的分层方式:
- 文案层:ChatGPT、Claude、豆包、Kimi、DeepSeek,负责脚本、字幕、旁白、分镜。
- 视觉层:可灵、即梦等,负责把提示词转成图像或视频素材。
- 工程层:Python 脚本、After Effects、FFmpeg,负责把素材组织成可渲染的工程。
2.2 Agent 不是“一个聊天机器人”,而是一个带任务边界的工作单元
很多文章把 Agent 解释得像一个秘书,能自动帮你完成所有事情。实际上在工程语境里,Agent 更接近“大模型 + 任务目标 + 工具 + 约束条件”的组合。你可以把每个提示词调用都设计成一个轻量 Agent:它只做一件事,输入什么格式,输出什么格式,不越权。
这也是 Agent 与 Agent harness 的区别:Agent 本身是策略和执行边界,而 harness 是承载这个策略的运行框架,负责调用模型、传递工具结果、处理循环。实际做项目时,你不需要先把某个复杂框架跑起来,可以先用手工提示词模拟出同等效果,等流程验证完毕再考虑工程化封装。
2.3 AE 模板的本质是“可复用的视觉组件”
AE 模板不是一个普通的视频文件,而是一种包含占位图层、表达式、色彩方案、转场效果的 After Effects 工程。你不需要从零开始设计动态背景墙,只需要把模板里的文字、图片、视频片段替换成自己的素材。它像编程里的组件库:接口已经定好,内容调用方只需要遵循约定。
2.4 背景墙和照片墙是同一类版式语言
背景墙、照片墙在宣传视频里指的通常是:多个相机或产品主视觉以网格、瀑布流或环绕布局出现在同一个大背景里,形成“一镜展示全家福”的效果。这特别适合 AI 工具汇总类视频,因为观众能在前 3 秒直观看到“这里有很多产品”。
理解了这四个概念后,就可以进入真实的工具选型环节。
3. 工具矩阵与适用边界
下面的表格是制作一条“SaaS AI 产品介绍宣传片”的常用工具分工。注意,这里的能力描述以公开使用场景和产品定位为主,不代表官方基准测试结果;工具更新也快,实际使用请以当前官网说明为准。
| 环节 | 可选工具 | 典型优势 | 使用注意 |
|---|---|---|---|
| 脚本与分镜 | ChatGPT、Claude | 复杂指令理解强、长文本结构清晰 | 需要给出严格的表格输出格式,否则容易自由发挥 |
| 中文语境整理 | 豆包、Kimi | 中文表达自然,适合信息汇总和改写 | 长文档对话要主动拆分,防止上下文丢失 |
| 代码与结构化文本 | DeepSeek | 代码、JSON、CSV、字幕文件这类结构化任务效率高 | 输出格式必须用示例约束,减少多余解释 |
| 视觉素材生成 | 可灵、即梦 | 把文字提示转成动态或图像素材 | 提示词要写清楚主视觉、比例、运动方式和配音留白 |
| 字幕与自动化脚本 | Python、FFmpeg | 批量生成 SRT、CSV,合并视频片段 | 编码统一使用 UTF-8,避免乱码 |
| 最终剪辑与背景墙排版 | After Effects + AE 模板 | 版式稳定、转场专业、可复用 | 先看模板占位图层名,再替换素材 |
确定分工后,最容易被忽略的是“输出格式”。如果让文案 Agent 输出一个自然段,视觉 Agent 可能看不懂哪里该分段;如果让它输出 Markdown 表格,Python 脚本又不好解析。所以建议在提示词里要求固定输出为CSV 或 JSON 结构,哪怕人工复制到下一步也方便。
从实际项目经验看,更高的做法是:每个 Agent 都有交付物,不是聊天记录。文案 Agent 的交付物是一张分镜表,视觉 Agent 的交付物是一组提示词文件,字幕 Agent 的交付物是 SRT。这样即使某个模型临时不可用,你也可以用手动方式替补,不会让整条流水线卡死。
4. 多 Agent 制作流水线怎么设计
这里给出一个适合中小团队参考的流水线。它不是某个产品的官方功能,而是一种组织方式,核心是“角色分离、格式受控、人审兜底”。
4.1 阶段划分
| 阶段 | 输入 | 输出 | 使用工具 |
|---|---|---|---|
| 策略 | 产品信息、目标观众 | 30-60 秒宣传片方向与核心表达 | 团队评审,不用模型 |
| 文案 | 核心表达、产品清单 | 分镜表(镜号、画面、字幕、旁白) | ChatGPT / Claude / 豆包 |
| 本地化 | 分镜表初稿 | 更科技感、口语顺滑的中文版本 | Kimi / 豆包 |
| 视觉提示 | 分镜表 | 每条镜头的视觉生成提示词 | DeepSeek 或人工 |
| 素材生成 | 视觉提示词 | 图像、视频片段 | 可灵 / 即梦 |
| 工程化 | 分镜表、素材 | CSV 数据、SRT 字幕、渲染列表 | Python、FFmpeg |
| 终剪 | 所有产物 | 成片 | AE 模板 + After Effects |
4.2 角色边界示例
用一页 JSON 描述这条流水线,放在团队共享文档里。它不会直接执行,但能让每个人明确自己负责哪一层:
{ "project": "saas_ai_tools_promo", "visual_style": "dark_tech_photo_wall", "agents": [ { "name": "script_writer", "model": "ChatGPT 或 Claude", "input": "产品资料、目标时长", "output": "markdown 分镜表", "rule": "字数不超限制,必须输出表格" }, { "name": "localize_reviewer", "model": "豆包 或 Kimi", "input": "分镜表初稿", "output": "优化后的中文分镜表", "rule": "只改表达,不擅自增加产品功能" }, { "name": "visual_prompt_builder", "model": "DeepSeek", "input": "分镜表", "output": "json 提示词文件", "rule": "每个提示词包含主体、背景墙布局、比例、运动方式" }, { "name": "subtitle_builder", "script": "python build_subtitles.py", "input": "分镜表 csv", "output": "subtitles.srt", "rule": "时间轴与分镜时长一致" } ] }这种方式最大的好处是有清晰基准线。以后换模型也好,换模板也好,只要输入输出格式不变,内部实现随便换。
4.3 关键点:把提示词当成代码管理
一旦进入多环节协作,提示词就不是“随手写几句话”,而是需要版本管理的配置。建议把提示词模板存入 Git,每轮修改都留记录。这样当一个模型升级后效果变差,你还可以回滚到旧提示词,而不是凭记忆重写。
5. 完整落地示例:SaaS 宣传片 + 照片墙 + AE 模板
下面用一条“AI 工具照片墙 30 秒宣传片”作为目标,逐步演示从提示词到工程文件的完整流程。你可以直接复制修改,跑出一个最小样片。
5.1 文案分镜阶段
给文案 Agent 的提示词示例:
你是一名 SaaS 产品宣传片策划。请基于以下产品清单,输出 6 个镜头的分镜表。 产品清单:ChatGPT、Claude、豆包、DeepSeek、可灵、即梦、Kimi。 成片时长:30 秒。 视觉主题:背景墙 / 照片墙,深色科技风。 输出格式为 Markdown 表格,列名分别是:镜号、画面描述、字幕文案、旁白文案、建议时长。 要求:画面描述必须包含“照片墙”元素;每条字幕不超过 15 个汉字;旁白为中文,整体节奏适合语音合成或真人配音。这段提示词里,最关键的是最后三条要求。没有格式约束,模型容易给你写成散文;没有“照片墙”提示,模型就会忽略这次宣传的结构;没有字数限制,AE 模板里的字幕框很容易被撑爆。
5.2 视觉提示词阶段
拿到分镜表后,不能直接把 Markdown 表格丢给可灵或即梦,因为它们更擅长处理“单幅画面”的提示词。这一步可以交给 DeepSeek 做结构转换,也可以人工改写。
一个可用的视觉提示词模板:
生成一张宽屏 16:9 的 AI 产品展示主视觉: 主体:大型科技海报墙,由多块竖屏组成,每块屏幕上显示一个 AI 对话界面或数据图表; 背景:深蓝与黑色渐变,带柔和光晕,有轻微颗粒质感; 布局:屏幕在画面中央呈弧形排列,形成照片墙效果; 气氛:未来感、干净、专业; 文字与 Logo:不需要出现具体品牌名称; 版权:仅作概念示意,不做商业产品展示。如果你需要动态视频素材,再把“生成一张图”改成“让画面缓慢推进”或“让屏幕内部图表持续流动”,但先提醒一下:不同视频生成工具对运动控制的理解和正确率并不一致,建议生成两到三个版本,由人工挑取最稳定的。
5.3 用 Python 把分镜表转成 AE 可用数据
当文案与视觉提示进入执行阶段,下一步是把分镜信息变成 AE 模板能读的数据。这里用一个最小 Python 脚本演示:读取一个分镜列表,输出ae_table.csv和subtitles.srt。
# 文件路径:build_promo_assets.py import csv from pathlib import Path shots = [ { "scene": "S01", "subtitle": "多模型协作,统一呈现", "duration": 3, "tool_name": "ChatGPT", "source": "assets/chatgpt_screen.png", }, { "scene": "S02", "subtitle": "中文文案更懂表达", "duration": 3, "tool_name": "Claude / Kimi / 豆包", "source": "assets/claude_screen.png", }, { "scene": "S03", "subtitle": "文字提示变成动态素材", "duration": 4, "tool_name": "可灵 / 即梦", "source": "assets/kling_jimeng.mp4", }, ] with open("ae_table.csv", "w", newline="", encoding="utf-8-sig") as f: writer = csv.DictWriter(f, fieldnames=list(shots[0].keys())) writer.writeheader() writer.writerows(shots) def timestamp(sec): h = sec // 3600 m = (sec % 3600) // 60 s = sec % 60 return f"{h:02d}:{m:02d}:{s:02d},000" start = 0 lines = [] for i, shot in enumerate(shots, 1): end = start + shot["duration"] lines.append(f"{i}\n{timestamp(start)} --> {timestamp(end)}\n{shot['subtitle']}\n") start = end Path("subtitles.srt").write_text("\n".join(lines), encoding="utf-8") print("已生成 ae_table.csv 与 subtitles.srt")运行方式:
python3 build_promo_assets.py这段脚本的作用不是“替代 AE”,而是让分镜数据变成统一的中转文件。ae_table.csv可以作为人工校对清单,也可以作为模板脚本的数据源;subtitles.srt可以直接导入剪辑软件自动生成字幕。
5.4 AE 模板中替换素材与合成背景墙
拿到 CSV 和 SRT 后,进入 AE 模板环节。不同模板的图层命名不同,但通用流程基本一致:
- 打开 AE 模板工程文件(通常后缀为
.aep),找到“背景墙”或“photo wall”合成。 - 查看模板内的文本图层命名,把
ae_table.csv中的字幕复制到对应文本图层,或者使用模板自带的数据驱动面板。 - 把视觉阶段生成的素材放入对应媒体占位图层。
- 调整时长、转场、入场动画,让素材运动节奏与字幕时间轴对齐。
- 将
subtitles.srt导入轨道,检查字体是否与模板统一。 - 输出时选择 H.264 或 PNG 序列,根据发布平台选择对应分辨率。
这里容易踩坑的地方是:模板里的占位文字长度。如果你的字幕太长,就会溢出画面。解决办法是在文案阶段就严格限制 15 个汉字以内,并在模板校准后才开始批量生成。
5.5 不用 AE 时的替代方案
如果团队暂时没有 After Effects,也不想购买模板,可以用 FFmpeg 做一个临时方案。先把素材按顺序写成列表:
# concat.txt file 'clip01.mp4' file 'clip02.mp4' file 'clip03.mp4'然后执行:
ffmpeg -f concat -safe 0 -i concat.txt -vf subtitles=subtitles.srt -c:v libx264 -pix_fmt yuv420p promo_v1.mp4这条命令会把片段拼接起来并烧录字幕。它处理不了复杂的照片墙版式,但至少能帮你快速验证文案、时长和字幕是否合理。
6. 运行结果与效果验证
脚本运行后的预期输出是两个文件:
ae_table.csv subtitles.srtae_table.csv的内容大致是这样:
scene,subtitle,duration,tool_name,source S01,多模型协作统一呈现,3,ChatGPT,assets/chatgpt_screen.png S02,中文文案更懂表达,3,Claude / Kimi / 豆包,assets/claude_screen.png S03,文字提示变成动态素材,4,可灵 / 即梦,assets/kling_jimeng.mp4subtitles.srt的内容会有三条时间轴字幕,每条时长分别对应 3 秒、3 秒、4 秒。
怎么判断这条流水线跑通了呢?建议设置三个检查点:
- 检查点一:文案交付后,分镜表里是否存在无法执行的“画面描述”。如果画面描述和照片墙没有关系,就退回文案 Agent 修改。
- 检查点二:视觉素材生成后,是否存在主体不清、文字乱码、品牌 Logo 错误。出现这些情况时不要浪费时间修图,直接改写提示词重新生成。
- 检查点三:AE 模板渲染后,字幕是否超出安全区域、背景墙版式是否在 16:9 下完整呈现。这一步是最终成片能不能用的底线。
如果只是跑通最小样片,不需要追求一步到位。先用一条 10 秒样片把“文案-提示词-素材-模板”四个环节走通,再扩展到 30 秒到 60 秒的完整宣传片。
7. 常见问题与排查思路
多 AI 协作项目里,问题往往不是“单个工具不会用”,而是“衔接处断裂”。下面汇总了最常见的几类问题:
| 问题现象 | 可能原因 | 排查方式 | 解决方案 |
|---|---|---|---|
| AE 模板打开后占位图层缺失 | 模板依赖第三方插件,当前环境未安装 | 打开“效果”面板检查报错插件 | 安装模板作者要求的插件,或换取同类别模板 |
| 中文字幕在模板里显示乱码 | 文件编码不统一 | 用文本编辑器查看 CSV/SRT 编码 | 统一导出为 UTF-8 或 UTF-8-BOM |
| 多个模型生成的素材风格不统一 | 没有给视觉 Agent 提供统一风格口令 | 检查每个视觉提示词开头是否一致 | 建立公共风格词库,放入每个提示词 |
| 生成素材里出现错误品牌信息 | 提示词没指定不出现品牌,模型自行联想 | 回查提示词约束项 | 显式添加“不出现真实品牌与 Logo” |
| Agent 调用中断或模型名称报错 | 配置文件里的模型名与当前 API 服务不匹配 | 查看日志中的模型参数 | 修正配置文件中的 model 字段,或回滚到可用版本 |
| 生成效果不稳定,同一条提示词结果差异大 | 视频生成类工具本身带有随机性 | 固定提示词但使用更高重试次数 | 多生成几版,人工挑选最符合分镜的片段 |
| 视频拼接后音频与字幕错位 | FFmpeg 参数中字幕时间轴与片段实际长度不一致 | 用播放器逐条对比时间轴 | 统一由脚本根据 duration 字段计算时间轴 |
| API 成本或配额超出预期 | 每步都调用大模型,未做规则兜底 | 查看日志统计每次调用的 token | 字幕、格式转换等琐事不用大模型,用脚本处理 |
最常见也最伤时间的,是“模型名称配置错误”。很多 Agent 开发工具会读取本地配置文件,例如一些命令行工具会从config.toml里读取model字段,一旦模型名写错,对话串就会中断。排查时先不要怀疑网络,优先看配置里的模型名是否与当前模型服务一致,必要时回退到默认模型。
8. 工程化最佳实践
下面这些建议,来自把“一次性制作”升级为“可持续内容工厂”的常见经验。它不是严格规范,而是一套低风险基线。
8.1 建立素材命名规范
不要出现最终版2.0再改3.0这种命名。推荐格式:
{产品名}_{场景}_{版本}_{日期}.{ext}例如:
DeepSeek_api_demo_v1_20250120.png Kimi_photo_wall_v2_20250120.mp4文件命名稳定后,CSV、SRT、AE 模板里的引用关系才不容易乱。
8.2 提示词也做版本管理
把每个 Agent 的提示词放在 Git 仓库,保存为.md或.txt。每次调整后提交,Commit Message 写明改动原因,例如“将字幕限制从 20 字改为 15 字,解决 AE 模板溢出问题”。这样当模型升级导致效果变化时,可以快速回滚到已验证版本。
8.3 API Key 与敏感信息隔离
所有 API Key 使用环境变量或密钥管理工具保存,不要硬编码进脚本。如果示例代码需要演示,就用占位符:
export LLM_API_KEY=your_api_key_here不要把密钥提交到 Git。如果使用 Agent 框架,还要检查工具是否会把上下文发送到外部服务,尽量选择你信任的服务链路。
8.4 品牌与版权合规
当画面涉及 ChatGPT、Claude、豆包、DeepSeek、可灵、即梦、Kimi 等品牌时,尽量使用官方公开素材或已获授权的素材。如果只是概念宣传,可以在提示词中明确“不出现真实 Logo”。发布前再做一个品牌合规检查,避免推广视频变成误导性内容。
8.5 保留人工审核节点
不要把大模型生成的成片直接发出去。至少设一个“视觉内容审核”节点:检查字幕错别字、敏感内容、竞品对比表述、品牌信息准确性。很多自动生成素材在单帧里看起来正常,连续播放后会出现闪变或逻辑矛盾,这些必须靠人眼过一遍。
8.6 控制成本与延迟
一个 30 秒视频如果每一步都用大模型完成,成本会快速上升。更合理的做法是按任务复杂程度分配:复杂分镜交给 Claude/ChatGPT,中文改写交给豆包/Kimi,纯格式转换交给 Python 脚本,能把成本降低不少。批量生成素材时留下重试预算,给视觉生成部分的失败预留空间。
9. 回到实践:下一步怎么把这条流水线跑起来
先不要急着追求“全自动”。你手头最需要的可能是一块白板,上面写清楚四件事:文案谁来写、视觉谁来做、数据怎么转、模板谁来套。把每个环节的输入输出格式固定下来,然后从一个小样片开始验证。
建议的第一个练习目标不是“生成一条完整宣传片”,而是生成一个 10 秒照片墙示范:3 条字幕、3 张素材图、一段 SRT、一次 FFmpeg 拼接。跑通一次之后,再把文案改成 CoT 风格的分镜表,把静态图换成可灵或即梦生成动态素材,最后换成正式 AE 模板渲染。
真正值得长期积累的资产,不是某个模型的回答,而是你手里的那套提示词模板、数据转换脚本和素材命名规则。这些内容换模型、换模板、换团队后依然可以复用。等这套流程运转稳定了,再考虑用 Agent 框架把它们封装成自动化节点,你会发现原本需要多人配合的宣传素材制作,已经压缩成一条低摩擦产线。
如果你最近正好要做一个 AI 工具合集或 SaaS 产品发布视频,建议收藏这份流程,先跑通最小样片再谈优化。下一次拿到需求时,你会庆幸自己已经把最浪费时间的“格式转换”和“角色分工”问题提前解决了。