口播视频 AI 剪辑完整实测:chengfeng-videocut-skills 从安装到成片一次跑通
2026/8/14 8:39:50 网站建设 项目流程

口播视频 AI 剪辑完整实测:chengfeng-videocut-skills 从安装到成片一次跑通

【免费下载链接】chengfeng-videocut-skills用 Claude Code Skills 做的视频剪辑 Agent项目地址: https://gitcode.com/gh_mirrors/vi/chengfeng-videocut-skills

chengfeng-videocut-skills 是一个给 Codex 用的中文口播剪辑插件:AI 负责听懂人话、找出口误与重复,确定性动作交给内置 Runtime 执行,人工只在审核页上把关。这篇文章不讲术语,只讲你怎么在一小时内用它剪出一条带字幕、带画面的成片,以及它和传统剪辑的差距到底有多大。

凌晨两点的剪辑台:一次被口误折磨的真实经历

想象这个画面:凌晨两点,你刚录完一条 19 分钟的口播,内容讲得不错,但里面有十几处说岔了的数字、三句重复的开头、两段改口重说。为了修掉它们,你得盯着剪映的时间轴,一句一句往回听——"这句是第几遍录的来着?""这句删了会不会断?"等熬到凌晨四点,你删了 8 处,还拿不准剩下几处该不该动。

这大概就是所有口播创作者的共同噩梦:素材是新鲜的,剪辑却把新鲜感耗光了。

chengfeng-videocut-skills 想解决的正是这个。它把"听懂人话再动手"这件事拆给 AI,把"按清单执行"留给程序,把"最终拍板"交还给你。听起来很玄?往下看,你会发现它做的事其实很简单。

先别急着眼花缭乱:它到底替你摆平了哪三件事

很多教程一上来就甩功能列表,你记不住也未必用得上。我们换个顺序,先说麻烦,再说解法。

麻烦一:语音转写出来的字是错的。

实测里,一份 39 个含英文字母词的转录稿,出现了 16 种写法——Grok被听成ClockGlock,甚至GokulCodex一会儿是CodeX,一会儿是codex。同一个文件转两遍,结果还不一样。字幕要是照着这个来,技术口播基本没法看。

解法是"词典闸门":项目内置一份术语词典,AI 转录后先过一遍词典把字改对,改完还会给你一张修字表,逐条告诉你"哪里的什么字改成了什么"。词典里没有、又拿不准的,AI 宁可报出来让你补,也不瞎猜。

麻烦二:重复和口误不是靠关键词能抓的。

传统工具抓"重复"靠模式匹配,可人话里的重复长这样:"给我做一份AI日报【最近我就关心】最近我就很关心剪辑"——前半句是不完整起头,后半句才是完整表达,该删的是前者。这种判断只能靠语义理解。

AI 的做法是"删前保后":前一遍不完整或说错了,删;后一遍完整,留。整个识别过程分成五轮扫描,每轮只盯一类——句间句内重复、残句改口、口误重说、英文卡壳、口头禅语气词。一次只带一个判据去读稿子,判断质量比一次带六个高得多。

麻烦三:剪错了没法撤销。

传统剪辑里"切一刀"是不可逆的文件操作,手抖一下就得重来。这个项目反着来:AI 阶段根本不碰媒体文件,只产出一份"删词账本"——哪几个词删、按什么理由删,改一次账本只要几十毫秒。你确认之后,物理剪切才发生。

一句话总结原理:AI 是判断的大脑,Runtime 是执行的手,账本是大脑和手之间唯一传话的文件。所有东西都绑在"词"的 ID 上,而不是绑定秒数——剪辑一变,字幕和画面层会自动跟着挪,不会出现"字幕过期"这种说不清道不明的错。

五分钟上手:从装依赖到第一条成片

全程七步,照着做就行。前提:一台 macOS 或 Windows 10/11 的机器,以及一个装好 Codex 的终端。

第 1 步:装好四个依赖。Bun(跑 Runtime)、Node.js、ffmpeg(剪辑与导出)、Google Chrome(渲染字幕和动画),缺哪个装哪个:

# macOS brew install oven-sh/bun/bun node ffmpeg # Windows(装完新开一个终端,PATH 才生效) winget install Oven-sh.Bun OpenJS.NodeJS.LTS Gyan.FFmpeg Google.Chrome

第 2 步:挂载并安装插件。两条命令分开执行,先挂市场,再从市场装插件:

codex plugin marketplace add Agentchengfeng/chengfeng-videocut-skills --ref edb0ee81d4bb7016e20d7fbbba14035c7caffbe3 codex plugin add chengfeng-videocut@chengfeng-videocut

也可以先用 git clone 把项目源码拿到本地研究:

git clone https://gitcode.com/gh_mirrors/vi/chengfeng-videocut-skills.git

第 3 步:让 Codex 把剪辑环境装好。装完插件后,直接对它说一句"安装剪辑环境"。它会检查插件和 Runtime 版本、缺什么下载什么(含 SHA-256 校验)、跑一遍 doctor 自检,最后告诉你环境就绪。

第 4 步:发起第一次剪辑。准备一条你自己的口播视频,然后说:

用"剪口播"处理这条视频。识别口误,等我审核后再物理剪切,并生成剪后字幕。

AI 会依次做:云端转录逐词稿 → 词典修字出修字表 → 五轮扫描找口误 → 汇总成两张表(删词汇总表 + 重复句子表)→ 把表呈给你看。

第 5 步:打开 Studio 亲自复核。这是整条链上唯一需要你说话的地方。在审核页里,删掉的词会划线标出,你可以逐条恢复"误伤"的句子,也可以补删 AI 漏掉的。别急着全选恢复——先看那两张表,重点听高风险项。

第 6 步(可选):加字幕、配画面。复核完,说"加字幕"或"配画面"。字幕直接按账本算时间,不需要重新转录;画面则是在录屏上盖圈重点、动画和推近。

第 7 步:导出成片。说"导出成片"。AI 会先跑--dry-run把计划念给你听——片长、帧数、字幕屏数、画面层数,数字不对就回去改上游;确认后一次性把剪辑、推近、字幕、画面层烧进同一个 mp4。

首次跑任务时,Runtime 会自动下载安装,那一次可能要等几分钟;之后就都是秒开。

同一条视频,两条路:传统手工 vs 账本式剪辑

用同一个 19 分钟口播做对照组,差异一目了然:

环节传统手工剪辑chengfeng-videocut-skills
听写自己听、自己记,或交给识别率不稳定的通用转写云端 ASR + 词典闸门 + 修字表,专名逐条可查
找口误反复回放,凭耳朵和记忆五轮语义扫描,每轮只找一类,输出两张可核对的表
改错成本每剪一刀都是不可撤销的文件操作先改账本(几十毫秒),确认后才物理剪切
人工介入全程动手只在三处说话:复核、改字、确认
判断依据主观感觉绑定词 ID + 播放顺序,剪辑后自动重算
学习能力每次从头开始复盘后把你的口味写进偏好文件,越用越懂你

说几个真实跑出来的数字:首个复盘项目里,AI 提交了 242 处删词提案,用户全盘采纳、零修改;一次因为提交方式不对,删词数从 430 掉到 394,被当场抓出来修正。这说明它不但能干,干得还基本符合人的预期——而那个"用户恢复的、用户补删的"复盘环节,就是它越用越准的秘密。

三个值得深挖的场景

功能不多讲,挑三个真实使用者最容易踩中、也最能出彩的场景说透。

场景一:录屏太糊,换高清源重导。

录屏工具常常能对同一次录制重新导出高分辨率版本。换源前先做两道硬校验:两个文件的时长精确到毫秒一致,且音频流逐位相同(用 ffmpeg 算 md5)。满足这两条,说明是同一个时间线,逐词稿、账本、字幕全都不用动。然后四步走:替换input/source.mp4并重建硬链接、更新project.json里的指纹、再更新workbench.json里的sourceSha256、最后用--scale 1重导。

坑就在第三步——指纹不止记在一处,漏改workbench.json会让预览直接报"生成失败"。项目宁可失败也不拿旧预览糊弄你,这个设计很硬核。

场景二:让 AI 记住你的剪辑口味。

剪完一轮,AI 会做一次复盘:你恢复掉的词,是它删错了;你补删的,是它漏了。这些差异会分门别类写进三个"抽屉"——口味差异进cut-preferences.md,专名错误进dictionary.md,规则空白记入"待升级判例"。你告诉它"静音阈值改严一点"、"保留适量嗯作为过渡",它下次就照办。用得越久,它剪出来的东西越像你亲手剪的。

场景三:给纯录屏口播加上"会动的画面"。

对着干巴巴的录屏讲技术,观众容易走神。画面 Skill 的四步是:读字幕按语义分段 → 抽 8-12 帧真的用眼睛看 → 用逐帧像素差找出滚动和切换的窗口 → 在稳定画面上盖层。需要圈重点就圈,需要解释概念就套用小黑漫画动画模板,推近最多 1.6 倍、区域取 62.5% 见方居中,避免把低清录屏放糊。

实测里 12 个段落有 2 段被画面推翻文字预判——"这地方该圈"和"这地方其实很清楚了,什么都不用动"往往只有看了帧才知道。

踩过的坑,说给你听

与其背故障列表,不如听听过来人踩坑时是什么反应。

"剪完播出来,怎么感觉哪里怪怪的?"先别急着怪剪辑。多数情况是删了高风险项——比如同一句话说了三遍,AI 只保留了最后一遍,但你没在审核页重点听那一处。处理办法:审核时优先听"重复句子表"里标了"高风险"的行,那里是 AI 自己也拿不准的地方。

"删词数量怎么自己变少了?"这是真实事故:第二次提交只交了新找到的两处,结果上一轮的四处在重建时被挤掉,删词数从 430 退到 394,声音听着还一切正常。现在提交采用替换语义,且强制检查"本次不再删的词数"——看到不为零,说明你交了增量,回去补全量。

"AI 把 Grok 听成 Gokul 了,怎么办?"这正是词典闸门存在的意义。别在命令里打补丁,把正确写法补进dictionary.md,下一条视频自动就对了。补一次,受益一辈子。

"换了高清源,预览却报生成失败?"九成是指纹没换干净。项目里记录源片指纹的地方不止一处,用搜索工具把旧指纹的前 8 位全找出来,逐处更新,再重导。

"推近的效果是不是丢了?"别凭整体印象判断——1.6 倍推近后的整页看起来仍像一整页。找"只有裁剪才能造成的证据":被切掉一半的气泡、消失的侧栏标题,和源片同刻帧一对比,一眼定案。

它还在往前走,你也可以现在就开始

这个项目最不寻常的地方,是它把"AI 判断"和"程序执行"焊死成了两道工序,中间用一份带版本号的账本互相咬合。所以你能看到它在一路补齐真实场景的边角:换源重导、跨平台(Windows 自 v0.4.2 起全链可用)、字幕按词锚定不绑秒、审核页里逐屏改字幕。往后的方向也很清楚:更准的语义判断、更顺的人工复核、更省事的成片产出——前提是每个版本都先过一遍"来源校验 + 人工确认"。

别光看。装好插件,找一条三分钟的口播素材,对着它说一句"剪口播",然后用五秒钟在审核页上划几条线。你会发现,凌晨两点的剪辑台,从此可以提前两个小时收工。

想深入了解实现细节,可以看剪口播的主流程文档 plugins/chengfeng-videocut/skills/chengfeng-cut/SKILL.md,以及五轮扫描背后的判断依据 plugins/chengfeng-videocut/skills/chengfeng-cut/references/semantic-deletion.md。

【免费下载链接】chengfeng-videocut-skills用 Claude Code Skills 做的视频剪辑 Agent项目地址: https://gitcode.com/gh_mirrors/vi/chengfeng-videocut-skills

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询