VoxCPM2:无Token化革命,用2B参数重塑多语言语音合成与克隆新纪元
你是否曾经被传统 TTS 系统中生硬的机械音、繁琐的文本预处理、以及难以还原真实情感的声音克隆所困扰?VoxCPM 的出现,将彻底改变这一局面。它是一款基于 Python 的无 Tokenizer(Tokenizer-Free)文本转语音系统,通过端到端的扩散自回归架构直接生成连续的语音表征,绕过了离散 Tokenization,从而实现了极其自然且富有表现力的语音合成。本文将带你全面了解这个正以火箭速度蹿升的语音合成新星。
截至收录:
VoxCPM项目stars数:35750
VoxCPM项目forks数:4092
VoxCPM项目目录截图

VoxCPM项目核心亮点
🌍 30种语言零门槛多语种合成:无需指定语言标签,直接输入任意支持语言的文本,模型自动识别并生成对应语言的语音。无论英语、中文、日语还是阿拉伯语,VoxCPM2 都能无缝切换,甚至支持四川话、粤语等九种中文方言,为全球化应用扫清语言障碍。
🎨 自然语言驱动的声音设计:仅凭一句话描述,如“一位年轻女性,温柔甜美的声音”,即可凭空创造出一个全新的、独一无二的合成声音。无需任何参考音频,便能实现音色、年龄、情感、语速的全方位定制,为内容创作者提供了近乎无限的创意空间。
🎙️ 顶级的”终极克隆”能力:提供参考音频及其文字转写文本,模型便会从音频连续性角度出发,不仅复刻音色,更会完美保留原声的韵律、情感和发声细节,达到”以一敌百”的原声复刻效果(1.5版本同款能力)。此外,VoxCPM2 还支持可控克隆,在保持音色的同时,通过文本指令调整情感与语速。
🔊 48kHz 录音室级高保真输出:内置 AudioVAE V2 的非对称编解码设计,让 VoxCPM2 具备原生超分辨率能力。接受 16kHz 的参考音频,就能直接输出 48kHz 采样率、CD 级音质的录音室级音频,无需任何外部后处理或升频模块。
VoxCPM项目快速开始
只需几步,你就能在本地跑起 VoxCPM2,体验前所未有的语音合成。
- 安装:
bash
pip install voxcpm
环境要求:Python ≥ 3.10(<3.13),PyTorch ≥ 2.5.0,CUDA ≥ 12.0。 - 合成你的第一段语音:
“`python
from voxcpm import VoxCPM
import soundfile as sfmodel = VoxCPM.from_pretrained(“openbmb/VoxCPM2″, load_denoiser=False)
wav = model.generate(
text=”VoxCPM2 is the current recommended release for realistic multilingual speech synthesis.”,
cfg_value=2.0,
inference_timesteps=10,
seed=42,
)
sf.write(“demo.wav”, wav, model.tts_model.sample_rate)
“` - 体验声音设计(无需参考音频):
python
wav = model.generate(
text="(A young woman, gentle and sweet voice)Hello, welcome to VoxCPM2!",
cfg_value=2.0,
inference_timesteps=10,
seed=42,
)
sf.write("voice_design.wav", wav, model.tts_model.sample_rate)
VoxCPM项目应用场景
场景一:多语言有声内容与影视制作:出版社或有声书平台可以使用 VoxCPM2 将文字脚本快速转换为 30 种语言的高保真有声书,极大降低配音成本和时间。影视与游戏制作团队则能通过”声音设计”功能,为虚拟角色打造独一无二的声线,再辅以”可控克隆”精准控制角色在不同情节下的情绪表现。
场景二:个性化语音助手与智能客服:企业可以利用”可控克隆”将录制的少量客服语音作为参考,快速生成 7×24 小时在线、具备统一音色且能根据用户情绪调整语气的AI客服。语音助手开发者亦可通过”终极克隆”复现特定名人的音色,或为用户提供个性化的发声服务。
场景三:端侧与实时交互部署:借助开放式生态(如 llama.cpp-omni、VoxCPM-ONNX),开发者可将 VoxCPM2 部署至 Apple Silicon 笔记本或是没有 Python 环境的边缘设备。配合 RTF低至~0.13(RTX 4090)的流式生成能力,VoxCPM2 完全适用于实时语音对话、直播互动等低延迟场景。
用户案例:目前,该模型已被 vLLM-Omni、llama.cpp-omni 等大型开源项目集成,以支撑其多模态与端侧推理能力;同时,社区已涌现出 ComfyUI-VoxCPM、TTS WebUI 等丰富的生态工具,广泛服务于音频内容创作与AI应用开发的各个环节。
VoxCPM项目链接
项目卡片
| 项目名称 | VoxCPM2 (OpenBMB) |
|---|---|
| GitHub Stars | 35,750 |
| GitHub Forks | 4,092 |
| 开发语言 | Python |
| 开源协议 | Apache-2.0 |
| 模型参数 | 2B |
| 支持语言 | 30种 (含9种中文方言) |
| 核心特色 | 无Token化、声音设计、可控/终极克隆、48kHz输出 |
| 官方仓库 | https://github.com/OpenBMB/VoxCPM |
