Insanely Fast Whisper:用极速把音频转成文字的开源 CLI 神器
你是否曾经被长达数小时的录音、访谈或会议纪要折磨得焦头烂额?手动听写费时费力,普通语音转写工具又慢又不准。Insanely Fast Whisper 的出现,彻底解决了这个痛点。它是一个基于 🤗 Transformers、Optimum 与 Flash Attention 2 构建的命令行语音转写工具,可以让开发者以疯狂的速度完成音频转录——150 分钟(2.5 小时)的音频,最快不到 98 秒就能转成文本。本文将带你全面了解这个“快得离谱”的开源新星。
截至收录:
Insanely Fast Whisper stars数:13048
Insanely Fast Whisper forks数:961
Insanely Fast Whisper 项目目录截图

Insanely Fast Whisper 核心亮点
🌟 亮点一(极致速度):在 NVIDIA A100 上,使用 Whisper large-v3 + Flash Attention 2 + 批处理,仅需 1 分 38 秒即可转录 150 分钟的音频;而使用 distil-large-v2 + Flash Attention 2,更是缩短到 1 分 18 秒。比传统 fp32 方案快了近 20 倍。
🎯 亮点二(一键 CLI):无需编写 Python 代码,通过 pipx 安装后,一条命令 insanely-fast-whisper --file-name <音频文件> 即可完成转录。支持本地文件或 URL,自动语言检测,开箱即用。
🔒 亮点三(先进技术栈):深度整合 Hugging Face Transformers 与 Optimum 的 BetterTransformer API,并可选 Flash Attention 2 加速。同时支持在 Apple Silicon(mps)上运行,让 Mac 用户也能享受高速转录。
🧩 亮点四(高扩展性与实用功能):支持指定模型(如 distil-whisper/large-v2)、批处理大小、转录/翻译任务、词级时间戳,甚至集成了 Pyannote.audio 说话人分离(diarization)功能,可区分不同说话人,适用于会议纪要等复杂场景。
Insanely Fast Whisper 快速开始
只需几步,你就能在本地高速转录音频:
- 安装(推荐使用
pipx,避免环境冲突):
bash
# 如果你还没有 pipx,先安装它
$ pip install pipx
# 然后安装 insanely-fast-whisper
$ pipx install insanely-fast-whisper - 运行你的第一个转录命令:
bash
$ insanely-fast-whisper --file-name <你的音频文件或URL>
如果你使用的是 macOS(Apple Silicon),请加上--device-id mps:
bash
$ insanely-fast-whisper --file-name <文件> --device-id mps - 查看所有可选项:
bash
$ insanely-fast-whisper --help
通过--flash True启用 Flash Attention 2,或使用--model-name distil-whisper/large-v2切换更轻量快速的模型。
Insanely Fast Whisper 应用场景
场景一:会议与访谈记录:记者、播客主持人和商务人士可以快速将数小时的访谈录音转为文字稿,结合说话人分离功能,还能自动区分不同发言者,极大提升整理效率。
场景二:视频字幕生成:视频创作者只需一行命令,即可为长视频生成带时间戳的字幕文件,省去逐句听写的痛苦,让内容发布流程大大提速。
场景三:语音数据集构建与科研:研究者可以利用该工具批量处理大规模音频数据,生成文本语料,用于训练或评估其他 NLP / ASR 模型。
用户案例:目前该社区项目已被不少开发者采用,衍生出了多个周边项目,如 ochen1/insanely-fast-whisper-cli、NextJS + Modal 构建的 Shush 应用,以及 kadirnar/whisper-plus Python 包。Hugging Face 社区和众多 AI 内容创作者也推荐使用这一工具来加速语音处理流程。
Insanely Fast Whisper 链接
Vaibhavs10 / insanely-fast-whisper项目地址:https://github.com/Vaibhavs10/insanely-fast-whisper
本文地址:https://www.tgoos.com/45908
