Pocket TTS:把强大TTS塞进你的CPU口袋
你是否曾为了一行语音合成代码,被迫拉起一个GPU实例,或者调用付费的云API?作为开发者,我们明明只想快速把文本转成音频,却常常卡在“环境配置太复杂”和“硬件成本太高”这道坎上。Kyutai Labs 推出的 Pocket TTS,正是为了彻底终结这种尴尬。它是一个用 Python 编写的轻量级文本转语音(TTS)工具,模型仅 1 亿参数,专门为 CPU 优化。无需 GPU,无需联网,pip install 之后一句函数调用就能生成自然流畅的语音。
截至收录:
Pocket TTS stars数:8657
Pocket TTS forks数:876
Pocket TTS项目目录截图

Pocket TTS核心亮点
🌟 极致轻量:模型仅有 100M 参数,却能在 CPU 上跑出约 6 倍实时速度(在 MacBook Air M4 上实测)。生成第一段音频的延迟仅约 200ms,且只占用 2 个 CPU 核心。
🎯 开箱即用:支持 Python 3.10 至 3.14,无需安装 GPU 版 PyTorch。一条 pip install pocket-tts 命令,即可通过 Python API 或 CLI 快速合成语音。更友好的是,官方还提供了可直接在浏览器里试玩的 Web 演示。
🔒 安全可控:所有推理都在本地设备完成,语音数据和文本内容不会上传至云端,从根源上规避了隐私泄漏风险。同时项目明确规定了禁止未经授权模仿或克隆他人声音等滥用行为,为技术使用划清了伦理边界。
🧩 生态丰富:除了官方 Python 实现,社区还贡献了 Rust/Candle、ONNX、C++、C#、Unity、ComfyUI 等十余种移植或集成方案。无论你是做 Web 应用、桌面软件还是嵌入式设备,都能找到合适的接入方式。
Pocket TTS快速开始
只需几步,你就能在本地运行起 Pocket TTS:
- 安装:
bash
# 使用 uv(推荐,自动管理依赖)
$ uvx pocket-tts generate
# 或使用 pip
$ pip install pocket-tts - 运行你的第一个命令:
bash
# 生成默认文本的语音,并保存为 ./tts_output.wav
$ pocket-tts generate
# 指定文本和音色
$ pocket-tts generate --text "你好,世界" --voice alba - 作为 Python 库使用:
“`python
from pocket_tts import TTSModel
import scipy.io.wavfiletts_model = TTSModel.load_model()
voice_state = tts_model.get_state_for_audio_prompt(“alba”)
audio = tts_model.generate_audio(voice_state, “Hello world, this is a test.”)
scipy.io.wavfile.write(“output.wav”, tts_model.sample_rate, audio.numpy())
“`
Pocket TTS应用场景
场景一:离线语音助手与播报系统:开发者可以在资源受限的边缘设备或本地服务器上部署 Pocket TTS,为智能音箱、导航播报、信息无障碍工具提供实时语音输出。例如社区项目 seshat-tts 就利用它为游戏和应用提供实时音频合成。
场景二:个性化语音克隆与内容创作:Pocket TTS 支持基于一段几秒到几十秒的音频样本进行语音克隆。创作者可以快速为有声书、视频配音、播客生成定制化音色,甚至通过 export-voice 命令将声音嵌入预计算成 safetensors 文件,实现毫秒级加载。
场景三:浏览器端与跨平台集成:得益于模型的小巧,社区已经通过 WebAssembly 将 Pocket TTS 移植到浏览器中运行。你可以在浏览器里实现“所见即所听”的交互式内容,甚至构建完全本地化的沉浸式应用,如「Hogwarts Legacy」角色语音对话工具。
用户案例:目前,pocket-reader(浏览器屏幕阅读器)、pocket-tts-wyoming(Home Assistant 语音集成)、LocalVocal.ai(Mac 本地语音助手)等众多项目都在使用 Pocket TTS 构建其语音能力。
Pocket TTS链接
kyutai-labs / pocket-tts项目地址:https://github.com/kyutai-labs/pocket-tts
本文地址:https://www.tgoos.com/46191
