Insanely Fast Whisper 语音转文字模型选型速查:3分钟定下 large-v3 与 distil-large-v2
【免费下载链接】insanely-fast-whisper项目地址: https://gitcode.com/GitHub_Trending/in/insanely-fast-whisper
Insanely Fast Whisper 是一个基于 Whisper 的本地语音转文字命令行工具,默认模型 large-v3 与蒸馏版 distil-large-v2 在速度和显存占用上差别明显。本文直接引用项目官方 A100 基准数据做模型选型速查,读完 3 分钟你就能定下该用哪一个。
2.5 小时音频跑了 31 分钟:时间都去哪了
第一次跑语音转写的人常会卡在同一件事上:150 分钟的音频转完,默认配置要等约 31 分钟,小显存显卡更早报 OOM。项目里其实有三个候选——large-v3、distil-large-v2 和 faster-whisper large-v2,选错配置,等待时间差 6 倍以上。
一张表看懂:三个选项的核心差异
| 维度 | large-v3(默认) | distil-large-v2 | faster-whisper large-v2(基线) |
|---|---|---|---|
| 定位 | OpenAI 多语言旗舰版 | 蒸馏轻量版 | C++ 推理引擎实现 |
| 下载体积 | 3.09G | 小于 large-v3 | 3.09G |
| 转 150 分钟音频(A100) | 1 分 38 秒(FP16+FA2) | 1 分 18 秒(FP16+FA2) | 8 分 15 秒(8bit) |
| 未优化时基线 | 31 分 1 秒(FP32) | 3 分 16 秒(FP16+BT) | 9 分 23 秒(FP16) |
| 显存压力 | 较高 | 较低 | 较低 |
| 典型用途 | 多语言、精度敏感 | 速度优先、硬件吃紧 | 示例 notebook 对照 |
一句话结论:同为 Transformers 路线的两个选项拉开优化后差距很小,distil 的显存压力更低;faster-whisper 只出现在 notebooks/ 的基准对照里,不是 CLI 的运行选项。
按场景拆:速度、显存、精度分别怎么选
表里的差距主要来自三个场景,逐个拆开看。
🏁 批量转写提速:distil 略快
结论:只拼吞吐,distil-large-v2 更快。依据是 README.md 在 NVIDIA A100 80GB 上的基准:同样的 FP16 + 批量 24 + Flash Attention 2 配置下,distil 转完 150 分钟音频用 1 分 18 秒,large-v3 用 1 分 38 秒;而 faster-whisper large-v2 即使用 8bit 也要 8 分 15 秒。排队处理大量音频时选 distil,整体耗时还能再砍掉约两成。
🧮 显存吃紧:Mac 和小显存卡
结论:distil 更容易跑得动。large-v3 单个权重文件就有 3.09G,insanely_fast_whisper_colab.ipynb 的下载日志可以佐证;README 的 FAQ 也提醒,Mac 的 mps 后端更吃内存,通常要把--batch-size降到 4(约占 12GB)。如果你频繁 OOM,先降 batch,再考虑换 distil。
🎯 精度与多语言:large-v3
仓库只给了速度基准、没给精度对比,这里按模型定位判断:large-v3 是 OpenAI 最新的多语言旗舰,CLI 为它保留了完整的--task transcribe/translate与--language参数(见 src/insanely_fast_whisper/cli.py);distil 是蒸馏出的轻量版。音频里混着外语、专业术语或噪声较大时,large-v3 是更稳的选择。
选谁?直接给答案
- 显存 24G+、单条音频要高精度→ 默认 large-v3,加
--flash True开 Flash Attention 2。 - Mac 或小显存卡、经常 OOM→
--device-id mps --batch-size 4;还放不下就换 distil。 - 大批量、拼速度→ distil(
--model-name distil-whisper/large-v2)。 - 需要把外语翻译成中文→ 只有 large-v3 支持(
--task translate)。
最小可跑步骤:从克隆到第一条转写
- 克隆项目,里面有示例 notebook 和完整文档:
git clone https://gitcode.com/GitHub_Trending/in/insanely-fast-whisper - 安装 CLI,README 锁定的版本是 0.0.15:
pipx install insanely-fast-whisper==0.0.15 --force - 运行一条体现关键差异的命令——加
--model-name切到 distil,省略则默认 large-v3:insanely-fast-whisper --model-name distil-whisper/large-v2 --file-name <音频路径或URL>
一句话收口
选型逻辑就一句:精度和多语言找 large-v3,速度和低显存找 distil。所有参数的默认值与说明见 README.md 的 CLI Options 一节,想手工搭推理流程可以看 notebooks/ 里的两个示例。
【免费下载链接】insanely-fast-whisper项目地址: https://gitcode.com/GitHub_Trending/in/insanely-fast-whisper
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考