如何用 pyVideoTrans 快速完成视频翻译与 AI 配音?完整教程
【免费下载链接】pyvideotransTranslate the video from one language to another and embed dubbing & subtitles.项目地址: https://gitcode.com/gh_mirrors/py/pyvideotrans
pyVideoTrans 是一款免费开源的视频翻译工具,把语音识别、多语言翻译、AI 配音和字幕生成整合成一条流水线,适合想发布多语言版本的内容创作者,也适合只想给视频加字幕的普通用户。
它到底能干什么 📼
这不是一款单一工具,而是一套 9 个阶段的处理流水线:抽音频、识别语音、翻译文本、合成配音、合成音视频。每个环节都可以单独换引擎——识别模块收录 22 种语音识别引擎,翻译模块收录 24 个翻译渠道,配音模块收录 34 种 TTS 引擎。它还支持说话人分离(自动判断视频里换过几次说话人,并给每人分配不同配音)和声音克隆(提供 5~10 秒清晰人声样本,即可模仿出相近音色)。
第一次使用的完整流程
Windows 用户直接下载预打包压缩包,解压到不含中文和空格的路径(如D:\pyVideoTrans),双击sp.exe即可。想从源码运行:
git clone https://gitcode.com/gh_mirrors/py/pyvideotrans cd pyvideotrans uv sync uv run sp.py界面操作分三步:选视频并设置源语言;选目标语言和翻译引擎;选配音引擎后开始。产出默认放在输入文件同级的_video_out目录,里面是翻译字幕和带配音的视频。不想打开界面时,可直接用命令行做整段视频翻译:
uv run cli.py --task vtv --name "./videos/demo.mp4" \ --source_language_code zh-cn --target_language_code en --voice_role "en-US-GuyNeural"命令行还有 stt/tts/sts 三种任务类型,分别对应语音转录、文字配音、字幕翻译,可以只取其中一环单独用。
按需求选引擎,而不是数引擎
引擎很多,按场景挑就行:
| 处理环节 | 本地离线方案 | 云端 API 方案 | 成本与效果 |
|---|---|---|---|
| 语音识别 | Faster-Whisper | 阿里 Qwen | 本地免费离线;Qwen 中文准确率高 |
| 文本翻译 | Ollama + M2M100 | DeepSeek / ChatGPT / Google | LLM 翻译最接近人工;Google 速度最快 |
| AI 配音 | F5-TTS(声音克隆) | Edge-TTS | Edge-TTS 完全免费;F5-TTS 需 5~10 秒人声样本 |
两条选线原则:数据敏感或网络差,全本地;追求译文质量,优先 LLM 翻译。
参数与配置怎么调 🔧
- 识别参数(降噪、标点恢复、LLM 重新断句)在识别参数设置里改,嘈杂环境或术语多的内容建议开启。
- 说话人分离与角色配音分配在说话人分离处理中实现,给每个说话人指定不同声音后,对话场景更自然。
- 有 NVIDIA 显卡时,装 CUDA 版 PyTorch 加 cuDNN 包即可加速,命令行加
--cuda参数生效。
批量处理与边界情况
--name参数支持通配符,写./videos/*.mp4就能一次处理整个文件夹,再配合定时任务就是自动化翻译流水线。需要完全断网时,翻译用本地 Ollama + M2M100,识别用本地 Whisper,全程视频不出机器。Web UI 提供网页版操作,适合部署在远程服务器上访问。想扩展新引擎,按现有文件模式往对应模块目录里加一个实现文件即可,各阶段之间互不影响。
【免费下载链接】pyvideotransTranslate the video from one language to another and embed dubbing & subtitles.项目地址: https://gitcode.com/gh_mirrors/py/pyvideotrans
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考