Insanely Fast Whisper 语音转文字模型选型速查:3分钟定下 large-v3 与 distil-large-v2
2026/9/13 6:39:53 网站建设 项目流程

Insanely Fast Whisper 语音转文字模型选型速查:3分钟定下 large-v3 与 distil-large-v2

【免费下载链接】insanely-fast-whisper项目地址: https://gitcode.com/GitHub_Trending/in/insanely-fast-whisper

Insanely Fast Whisper 是一个基于 Whisper 的本地语音转文字命令行工具,默认模型 large-v3 与蒸馏版 distil-large-v2 在速度和显存占用上差别明显。本文直接引用项目官方 A100 基准数据做模型选型速查,读完 3 分钟你就能定下该用哪一个。

2.5 小时音频跑了 31 分钟:时间都去哪了

第一次跑语音转写的人常会卡在同一件事上:150 分钟的音频转完,默认配置要等约 31 分钟,小显存显卡更早报 OOM。项目里其实有三个候选——large-v3、distil-large-v2 和 faster-whisper large-v2,选错配置,等待时间差 6 倍以上。

一张表看懂:三个选项的核心差异

维度large-v3(默认)distil-large-v2faster-whisper large-v2(基线)
定位OpenAI 多语言旗舰版蒸馏轻量版C++ 推理引擎实现
下载体积3.09G小于 large-v33.09G
转 150 分钟音频(A100)1 分 38 秒(FP16+FA2)1 分 18 秒(FP16+FA2)8 分 15 秒(8bit)
未优化时基线31 分 1 秒(FP32)3 分 16 秒(FP16+BT)9 分 23 秒(FP16)
显存压力较高较低较低
典型用途多语言、精度敏感速度优先、硬件吃紧示例 notebook 对照

一句话结论:同为 Transformers 路线的两个选项拉开优化后差距很小,distil 的显存压力更低;faster-whisper 只出现在 notebooks/ 的基准对照里,不是 CLI 的运行选项。

按场景拆:速度、显存、精度分别怎么选

表里的差距主要来自三个场景,逐个拆开看。

🏁 批量转写提速:distil 略快

结论:只拼吞吐,distil-large-v2 更快。依据是 README.md 在 NVIDIA A100 80GB 上的基准:同样的 FP16 + 批量 24 + Flash Attention 2 配置下,distil 转完 150 分钟音频用 1 分 18 秒,large-v3 用 1 分 38 秒;而 faster-whisper large-v2 即使用 8bit 也要 8 分 15 秒。排队处理大量音频时选 distil,整体耗时还能再砍掉约两成。

🧮 显存吃紧:Mac 和小显存卡

结论:distil 更容易跑得动。large-v3 单个权重文件就有 3.09G,insanely_fast_whisper_colab.ipynb 的下载日志可以佐证;README 的 FAQ 也提醒,Mac 的 mps 后端更吃内存,通常要把--batch-size降到 4(约占 12GB)。如果你频繁 OOM,先降 batch,再考虑换 distil。

🎯 精度与多语言:large-v3

仓库只给了速度基准、没给精度对比,这里按模型定位判断:large-v3 是 OpenAI 最新的多语言旗舰,CLI 为它保留了完整的--task transcribe/translate--language参数(见 src/insanely_fast_whisper/cli.py);distil 是蒸馏出的轻量版。音频里混着外语、专业术语或噪声较大时,large-v3 是更稳的选择。

选谁?直接给答案

  • 显存 24G+、单条音频要高精度→ 默认 large-v3,加--flash True开 Flash Attention 2。
  • Mac 或小显存卡、经常 OOM--device-id mps --batch-size 4;还放不下就换 distil。
  • 大批量、拼速度→ distil(--model-name distil-whisper/large-v2)。
  • 需要把外语翻译成中文→ 只有 large-v3 支持(--task translate)。

最小可跑步骤:从克隆到第一条转写

  1. 克隆项目,里面有示例 notebook 和完整文档:git clone https://gitcode.com/GitHub_Trending/in/insanely-fast-whisper
  2. 安装 CLI,README 锁定的版本是 0.0.15:pipx install insanely-fast-whisper==0.0.15 --force
  3. 运行一条体现关键差异的命令——加--model-name切到 distil,省略则默认 large-v3:insanely-fast-whisper --model-name distil-whisper/large-v2 --file-name <音频路径或URL>

一句话收口

选型逻辑就一句:精度和多语言找 large-v3,速度和低显存找 distil。所有参数的默认值与说明见 README.md 的 CLI Options 一节,想手工搭推理流程可以看 notebooks/ 里的两个示例。

【免费下载链接】insanely-fast-whisper项目地址: https://gitcode.com/GitHub_Trending/in/insanely-fast-whisper

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询