从剧本到成片:Agency Orchestrator 短剧流水线(文生图 / 图生视频 / ffmpeg 合成)完整实战
【免费下载链接】agency-orchestrator🚀 One sentence → your one-person company of AI experts → complete deliverable in minutes. 276 CN + 184 EN + 5 more languages (ko/ru/pt-BR/id/ar) · zero-code YAML · auto-verified acceptance · Web Studio / Desktop / Docker · 15 LLM providers (11 key-free). 一句话组建你的「一人公司」AI 专家团队,几分钟交付完整方案;验收自动核验,网页 / 桌面 / Docker 全渠道。项目地址: https://gitcode.com/gh_mirrors/ag/agency-orchestrator
Agency Orchestrator(AO)是一个开源的 AI 专家团队编排器:用自然语言一句话组建多角色 AI 团队,按 DAG 并行执行并自动验收。它的内置模板「短剧流水线(3 镜)」可以把一句话故事直接变成成片——AI 编剧写三镜微剧本 →文生图出主角定妆图 →图生视频三镜并行出片 → 本机ffmpeg自动合成旁白、字幕与 BGM,全程零代码、成本按秒可见。
这条 AI 短剧流水线能做什么
整条链路对应 14 个步骤,引擎按依赖关系自动调度,其中「三镜提示词」与「三镜出片」是并行的:
| 阶段 | 步骤 | 说明 |
|---|---|---|
| 剧本 | ✍️ 编剧 | 一句话故事 → 3 镜微剧本(建立 / 冲突 / 收束) |
| 锁定 | 🎚 氛围锁定块 | 全片只写一次,三镜逐字共用,杜绝色调断裂 |
| 定妆 | 🧍 定妆提示词 + 🎨 文生图 | 主角正面全身定妆图,作为后面每镜的「首帧」 |
| 出片 | 🎬 三镜提示词 → 🎥 图生视频 | 三镜并行,同一张定妆图当首帧,人物不变脸 |
| 配音 | 📝 旁白 + 🎙 TTS(可选) | 选中文字数自动卡口播语速,念不完会被截断 |
| 合成 | 🎞 ffmpeg 三镜合一 | 本机拼接 + 旁白 + 字幕 + BGM 淡出,不花厂商的钱 |
| 交付 | 📦 交付页 | 成片、定妆图、三镜、成本一行汇总 |
模板文件:workflows/短剧流水线.yaml,提示词方法论:ao-skills/shortfilm-prompt/SKILL.md。
3 分钟搭建环境:安装 AO 与 ffmpeg
1️⃣ 安装(二选一):
npm install -g agency-orchestrator # CLI,之后用 ao web 打开网页 Studio也提供桌面客户端(Electron,自带引擎与 Node,双击即用)。
2️⃣ 安装 ffmpeg(合成步骤用它,各平台一条命令):
brew install ffmpeg # macOS sudo apt install ffmpeg # Ubuntu winget install ffmpeg # Windows3️⃣ 配置供应商密钥:网页 Studio 右上角「供应商」页填写图片 / 视频 / 语音的 API key,密钥只存本机(.local/web-keys.json),不上传任何服务器。
💡 视频供应商默认是 APIMart——因为秘塔等供应商只收公网 URL的首帧图,而定妆图是本机产物;APIMart 带自动上传接口,本地图直接用。
运行「短剧流水线(3 镜)」:输入项全解
在 Studio 的「工作流」页找到模板点「运行」,或在命令行执行:
ao run workflows/短剧流水线.yaml -i story="末日废城里一个机器人清道夫捡到一只会说话的鸵鸟" -i genre="科幻"核心输入只有 6 项,其余都有默认值:
| 输入 | 建议 | 备注 |
|---|---|---|
| 故事梗概 | 两三句话即可 | 必填 |
| 类型 | 剧情短剧 / 科幻 / 悬疑 / 广告片等 8 选 | 决定运镜与节拍写法 |
| 视觉风格 | 风格库 15 个预设任选(默认「美式复古好莱坞」) | 引擎自动展开成摄影机 / 胶片 / 色调的英文后缀 |
| 图片 / 视频供应商 + 模型 | 下拉选择 | 换赞助商 = 换下拉,不用改配置 |
| 分辨率 / 秒数 | 默认 720p × 8 秒(最便宜档) | 3 镜合计 ×3,方向满意再升档 |
| 旁白配音 | 默认「不配音」 | Veo3 / Sora2 本来就出声,先听一遍原片 |
想自己调风格?风格样例长这样(默认档「美式复古好莱坞」):
角色为什么不变脸:定妆图 + 图生视频首帧锁定
多镜作品最常见的翻车就是「镜镜换脸」。AO 的解法很朴素:
- 先用文生图出一张「正面全身、浅灰背景、棚光」的主角定妆图;
- 三镜出片时都把这张图作为图生视频的首帧(
video.image),人物从同一张脸开始动; - 色调则由「氛围锁定块」锁死——机身镜头型号、色彩影调、光源、颗粒度全片逐字粘贴,不每镜重写。
出片步骤还会自动抽 3 帧看图验收:核对「是不是定妆图里同一个人、画面上有没有乱加字幕水印」。
ffmpeg 自动合成:旁白、字幕、BGM 一步到位
最后一步type: concat由本机 ffmpeg 完成(实现见 src/media/concat.ts),合成不花厂商的钱,且做了三件新手容易踩坑的事:
- 自动规整:三镜可能来自不同模型,尺寸 / 帧率 / 音轨各不相同,引擎先统一再无损拼接,不会花屏;
- 旁白让位:片段自带音轨默认压到 0.3 音量给旁白让路(视频模型常自带对白,想保留原声可调回 1,想全换旁白就写 0);
- BGM 淡出:背景音乐自动循环铺满全片、末尾 2 秒淡出、默认 0.22 音量不盖人声。
省钱与重跑技巧:按秒计费怎么控制成本
视频按秒计费,模板默认就给了最便宜的 720p × 8 秒档(Veo3 固定 8 秒)。几条实用建议:
- 先跑短档验证方向,满意了再改
video_resolution上 1080p / 4k 或加秒数; - 竖屏发抖音 / 视频号:把
video_ratio改9:16(注意定妆图比例也要跟着横竖); - 单镜不满意不用整片重跑,断点续跑只花那一镜的钱:
ao run workflows/短剧流水线.yaml --resume last --from shot2- 带修改意见返工:
--feedback "运镜再慢一点"会把上一版产出 + 你的意见交给对应专家改,不推倒重来。
核心文件资料
| 资料 | 路径 |
|---|---|
| 短剧流水线(3 镜)模板 | workflows/短剧流水线.yaml |
| 5 段式视频提示词方法论(含 14 条翻车规避) | ao-skills/shortfilm-prompt/SKILL.md |
| ffmpeg 多镜合成实现(旁白 / 字幕 / BGM) | src/media/concat.ts |
| 轻量版:一句话直接出单条短片 | workflows/一句话出短片.yaml |
| 项目总览与安装指南 | README.md |
一句话总结:剧本靠编剧角色、一致性靠定妆图首帧、成片靠本机 ffmpeg——模型和成本你说了算,流水线是你的。换个故事梗概再跑一遍,几分钟又是一条片。
【免费下载链接】agency-orchestrator🚀 One sentence → your one-person company of AI experts → complete deliverable in minutes. 276 CN + 184 EN + 5 more languages (ko/ru/pt-BR/id/ar) · zero-code YAML · auto-verified acceptance · Web Studio / Desktop / Docker · 15 LLM providers (11 key-free). 一句话组建你的「一人公司」AI 专家团队,几分钟交付完整方案;验收自动核验,网页 / 桌面 / Docker 全渠道。项目地址: https://gitcode.com/gh_mirrors/ag/agency-orchestrator
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考