FunClip:免费开源的AI视频剪辑工具,3步上手智能字幕裁剪与LLM剪辑
【免费下载链接】FunClipFunASR-powered video transcription, subtitle generation, and LLM-assisted clipping tool with a local Gradio UI.项目地址: https://gitcode.com/GitHub_Trending/fu/FunClip
你有没有遇到过这样的场景:一段一小时的讲座录像,你只想要其中三分钟的金句;一场两个小时的会议回放,你只想留下某位发言人的全部内容;一部访谈视频,你想把"最有价值的那几句话"单独剪成一条短视频。传统做法是把视频拖进剪辑软件,反复拖动进度条、放大波形、手动对齐文字——光是找对位置就要花掉大把时间。而 FunClip 正是为解决这类痛点诞生的免费开源 AI 视频剪辑工具:它先听懂视频里说了什么,再把"说话内容"变成可勾选的文字清单,你选哪句,它就剪哪句,全程无需付费、本地部署、保护隐私。
没有它 vs 有了它:视频剪辑效率的两种人生
先直观感受一下 FunClip 带来的差异。同样是"从视频里提取指定片段"这件事:
| 对比维度 | 传统手动剪辑 | 使用 FunClip |
|---|---|---|
| 找片段位置 | 反复拖动进度条、听声辨位 | 自动转写全文,按文字直接定位 |
| 提取特定人物发言 | 逐段核对人脸和声音 | 一键按说话人 ID 全量提取 |
| 剪多段内容 | 逐个导出再拼接 | 多段文本一次裁剪,自动输出 SRT 字幕 |
| 找"精彩片段" | 靠感觉凭经验 | 大语言模型理解语义后自动圈选 |
| 成本 | 付费软件订阅或漫长学习 | 免费开源,本地运行,不传数据上云 |
一句话概括:传统剪辑让你在时间轴上"找针",FunClip 让你在文字里"勾选"。省下的时间,足够你多剪十条视频。
60秒极速上手:从零到本地服务跑起来
FunClip 的运行依赖非常简单,一个 Python 环境足矣。按下面三步操作即可:
git clone https://gitcode.com/GitHub_Trending/fu/FunClip cd FunClip pip install -r ./requirements.txt依赖装好后,执行一条命令启动本地服务:
python funclip/launch.py稍等片刻(首次启动会自动下载 ASR 模型权重,之后会缓存在本地),浏览器访问localhost:7860就能看到主界面。之后的操作只有三个动作:上传视频 → 点击"识别" → 复制想保留的文字到"待裁剪文本"框 → 点击"裁剪"。整个过程不到一分钟,你就能拿到第一个带时间戳对齐的成品片段。
FunClip 的 AI 视频剪辑工具主界面,视频上传、语音识别、字幕输出与裁剪按钮一屏搞定
如果你处理的是英文视频,启动时加一个参数即可:python funclip/launch.py -l en。
三大核心亮点拆解:它凭什么让剪辑变简单
亮点一:语音识别+精准裁剪,让"剪视频"变成"选文字"
是什么:FunClip 内置了阿里巴巴通义实验室开源的 FunASR 工具包与 Paraformer-Large 模型,这是目前识别效果最好的开源中文 ASR 模型之一。它能自动把视频里的语音转成带时间戳的文字,并同时生成全文 SRT 字幕。
为什么强:识别结果里的每一句话都精确对应着视频中的起止时间。你不需要理解任何剪辑术语,只需在识别结果里复制想要保留的句子(多段文本用#连接),点击裁剪,即可获得对齐精准的片段。它还支持每段独立配置起止偏移量,用来微调前后留白。
怎么用:上传视频后点击"识别",在"识别结果"中复制目标文字到"待裁剪文本",再点"裁剪"或"裁剪+字幕"。若想给成品直接烧录字幕,记得提前安装 imagemagick(Ubuntu 执行apt-get install imagemagick,macOS 执行brew install imagemagick),项目还自带了默认黑体字体文件font/STHeitiMedium.ttc供字幕渲染使用。
视频智能字幕裁剪教程核心流程:上传视频 → 配置热词识别 → 选择文本裁剪
亮点二:说话人分离,把某个人"拎"出来单独成片
是什么:FunClip 集成了 CAM++ 说话人识别模型。点击"识别+区分说话人"按钮,每一句识别结果都会被自动标记上说话人 ID(如spk0、spk3)。
为什么强:访谈、会议、播客这类多人口播视频,传统方式要按人逐段剪接,而 FunClip 让你直接在"待裁剪说话人"输入框里填一个 ID(多个人用#连接),就能一键提取该说话人的全部段落,自动拼合成一条连续视频。
怎么用:识别时选择"识别+区分说话人",查看结果中每句话所属的说话人 ID,把目标 ID 填入"待裁剪说话人"框,点击"裁剪"即可。界面上还内置了"多说话人示例视频"供你直接体验这一功能。
亮点三:LLM 智能裁剪,让大模型替你挑"精华"
是什么:FunClip 最出彩的能力,是让大语言模型参与剪辑决策。它集成了 Qwen、GPT、DeepSeek、Moonshot、MiniMax 等多条模型调用通道,并提供了完整的 Prompt 配置接口,相关实现集中在 funclip/llm/ 目录下。
为什么强:当你面对长视频不知道"哪一段最值得剪"时,LLM 会读取整份 SRT 字幕,按你设定的指令(比如"分析精彩且尽可能连续的片段,输出四条以内")理解语义,返回规范格式的时间戳列表,再交给 FunClip 自动执行裁剪。默认 Prompt 已经过打磨,你也可以自由改写,实现"提取教学重点""筛选情感强烈段落"等定制需求。
怎么用:识别完成后,在"LLM 智能裁剪"标签页选择模型(如deepseek-chat或qwen-plus),填入对应 API Key,点击"LLM 推理",确认推理结果后点击"LLM 智能裁剪"即可成片。想给结果加上字幕,就点"LLM 智能裁剪+字幕"。
AI 视频剪辑工具的 LLM 智能裁剪教程:选模型填 Key → 微调 Prompt → 推理并裁剪
避坑指南:新手最容易踩的 5 个坑
1. 首次启动迟迟没有界面。模型权重是启动时单独下载的,网络不稳定会卡在下载阶段。解法:保持网络畅通耐心等待,或提前用代理下载模型;权重落盘后会本地缓存,后续启动无需重复下载。
2. 精确按文本裁剪时发现时间戳对不准。如果你用-m fun-asr-nano或-m sensevoice启动,当前发布的 Nano 检查点不提供可靠的字符级时间戳。解法:需要精确按文字裁剪时,请使用默认的 Paraformer 模型。
3. 字幕烧录失败或文字乱码。原因是没装 imagemagick,或未修改其安全策略。Ubuntu 用户执行sed -i 's/none/read,write/g' /etc/ImageMagick-6/policy.xml,macOS 用户对应修改ImageMagick-7的 policy.xml;Windows 用户需在site-packages\moviepy\config_defaults.py中配置IMAGEMAGICK_BINARY路径。
4. 同时打开多个同端口页面导致上传卡死。这会引发文件上传缓慢甚至无响应。解法:只保留一个localhost:7860页面,其余全部关闭。
5. 依赖版本过旧导致 SenseVoice/字幕功能异常。FunClip 的 Fun-ASR-Nano、SenseVoice 与字幕兼容路径要求funasr>=1.3.29。解法:旧环境先执行pip install -U "funasr>=1.3.29"再启动服务。
进阶玩法:藏在源码里的 3 个高阶能力
1. 命令行流水线批量处理。Gradio 界面适合交互,但批处理场景可以直接调用 funclip/videoclipper.py:--stage 1完成识别并输出识别文本与 SRT 文件,--stage 2配合--dest_text指定目标文字、--start_ost/--end_ost设置偏移、--output_file指定输出路径。把它套进 shell 循环,即可实现成批视频的自动化裁剪。
2. 换引擎:Fun-ASR-Nano 与 SenseVoice 的多语种能力。FunClip 不仅支持中文,还支持切换旗舰版 Fun-ASR-Nano(覆盖普通话、英语、日语、7 类中文方言与 26 种地域口音)和 SenseVoice(多语种识别 + 情绪识别 + 音频事件检测)。启动命令分别是python funclip/launch.py -m fun-asr-nano和python funclip/launch.py -m sensevoice,详细说明见 README_zh.md。
3. 让 LLM"看"视频而非只读字幕。针对纯文本判断不清的片段(动作、场景切换、画面事件),FunClip 可选接入 TwelveLabs Pegasus 视频理解模型:选择pegasus1.5模型名并填入对应 Key 后,它会直接分析视频画面与音频,输出同样格式的时间戳,复用"AI 裁剪"按钮即可成片,入口代码在 funclip/llm/twelvelabs_api.py。
适用人群自测:这 5 类人闭眼入
如果你符合以下任意一条,这本工具就是为你准备的:
- 短视频创作者:需要从长素材里高频提取精彩片段,不想把时间耗在手动对齐上。
- 教师与培训师:想从讲座录像里快速切出知识点片段,或生成带时间戳的教学材料。
- 会议记录员:要从冗长会议回放中提取某位发言人的全部内容,或整理决策点段落。
- 字幕/内容运营:需要批量产出带 SRT 字幕的视频切片,用于分发或二次加工。
- 隐私敏感的技术爱好者:希望剪辑全程在本机完成,数据不出设备,同时想研究 ASR 与大模型结合的工程实现。
现在就去剪出你的第一条 AI 视频
FunClip 完全开源(源码采用 MIT 协议)、本地部署、零费用,功能代码集中在 funclip/ 目录,你可以直接阅读、修改甚至二次开发,把它的能力嵌入自己的产品。从"找片段"到"选文字",再到"让大模型替你挑精华",这个免费的 AI 视频剪辑工具重新定义了个人剪辑的边界。打开终端,执行python funclip/launch.py,几分钟后你就能拥有自己的智能剪辑工作台——这条视频,剪起来。
【免费下载链接】FunClipFunASR-powered video transcription, subtitle generation, and LLM-assisted clipping tool with a local Gradio UI.项目地址: https://gitcode.com/GitHub_Trending/fu/FunClip
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考