VoxCPM2:无Token化革命,用2B参数重塑多语言语音合成与克隆新纪元

你是否曾经被传统 TTS 系统中生硬的机械音、繁琐的文本预处理、以及难以还原真实情感的声音克隆所困扰?VoxCPM 的出现,将彻底改变这一局面。它是一款基于 Python 的无 Tokenizer(Tokenizer-Free)文本转语音系统,通过端到端的扩散自回归架构直接生成连续的语音表征,绕过了离散 Tokenization,从而实现了极其自然且富有表现力的语音合成。本文将带你全面了解这个正以火箭速度蹿升的语音合成新星。

截至收录:
VoxCPM项目stars数:35750
VoxCPM项目forks数:4092

VoxCPM项目目录截图

VoxCPM项目核心亮点

🌍 30种语言零门槛多语种合成:无需指定语言标签,直接输入任意支持语言的文本,模型自动识别并生成对应语言的语音。无论英语、中文、日语还是阿拉伯语,VoxCPM2 都能无缝切换,甚至支持四川话、粤语等九种中文方言,为全球化应用扫清语言障碍。
🎨 自然语言驱动的声音设计:仅凭一句话描述,如“一位年轻女性,温柔甜美的声音”,即可凭空创造出一个全新的、独一无二的合成声音。无需任何参考音频,便能实现音色、年龄、情感、语速的全方位定制,为内容创作者提供了近乎无限的创意空间。
🎙️ 顶级的”终极克隆”能力:提供参考音频及其文字转写文本,模型便会从音频连续性角度出发,不仅复刻音色,更会完美保留原声的韵律、情感和发声细节,达到”以一敌百”的原声复刻效果(1.5版本同款能力)。此外,VoxCPM2 还支持可控克隆,在保持音色的同时,通过文本指令调整情感与语速。
🔊 48kHz 录音室级高保真输出:内置 AudioVAE V2 的非对称编解码设计,让 VoxCPM2 具备原生超分辨率能力。接受 16kHz 的参考音频,就能直接输出 48kHz 采样率、CD 级音质的录音室级音频,无需任何外部后处理或升频模块。

VoxCPM项目快速开始

只需几步,你就能在本地跑起 VoxCPM2,体验前所未有的语音合成。

  1. 安装
    bash
    pip install voxcpm

    环境要求:Python ≥ 3.10(<3.13),PyTorch ≥ 2.5.0,CUDA ≥ 12.0。
  2. 合成你的第一段语音
    “`python
    from voxcpm import VoxCPM
    import soundfile as sf

    model = VoxCPM.from_pretrained(“openbmb/VoxCPM2″, load_denoiser=False)
    wav = model.generate(
    text=”VoxCPM2 is the current recommended release for realistic multilingual speech synthesis.”,
    cfg_value=2.0,
    inference_timesteps=10,
    seed=42,
    )
    sf.write(“demo.wav”, wav, model.tts_model.sample_rate)
    “`

  3. 体验声音设计(无需参考音频)
    python
    wav = model.generate(
    text="(A young woman, gentle and sweet voice)Hello, welcome to VoxCPM2!",
    cfg_value=2.0,
    inference_timesteps=10,
    seed=42,
    )
    sf.write("voice_design.wav", wav, model.tts_model.sample_rate)

VoxCPM项目应用场景

场景一:多语言有声内容与影视制作:出版社或有声书平台可以使用 VoxCPM2 将文字脚本快速转换为 30 种语言的高保真有声书,极大降低配音成本和时间。影视与游戏制作团队则能通过”声音设计”功能,为虚拟角色打造独一无二的声线,再辅以”可控克隆”精准控制角色在不同情节下的情绪表现。

场景二:个性化语音助手与智能客服:企业可以利用”可控克隆”将录制的少量客服语音作为参考,快速生成 7×24 小时在线、具备统一音色且能根据用户情绪调整语气的AI客服。语音助手开发者亦可通过”终极克隆”复现特定名人的音色,或为用户提供个性化的发声服务。

场景三:端侧与实时交互部署:借助开放式生态(如 llama.cpp-omni、VoxCPM-ONNX),开发者可将 VoxCPM2 部署至 Apple Silicon 笔记本或是没有 Python 环境的边缘设备。配合 RTF低至~0.13(RTX 4090)的流式生成能力,VoxCPM2 完全适用于实时语音对话、直播互动等低延迟场景。

用户案例:目前,该模型已被 vLLM-Omnillama.cpp-omni 等大型开源项目集成,以支撑其多模态与端侧推理能力;同时,社区已涌现出 ComfyUI-VoxCPMTTS WebUI 等丰富的生态工具,广泛服务于音频内容创作与AI应用开发的各个环节。

VoxCPM项目链接

 


项目卡片

项目名称 VoxCPM2 (OpenBMB)
GitHub Stars 35,750
GitHub Forks 4,092
开发语言 Python
开源协议 Apache-2.0
模型参数 2B
支持语言 30种 (含9种中文方言)
核心特色 无Token化、声音设计、可控/终极克隆、48kHz输出
官方仓库 https://github.com/OpenBMB/VoxCPM
声明:本站资源均整理自互联网,版权归原作者所有,仅供学习交流使用,请勿直接商用,若需商用请购买正版授权。因违规使用产生的版权及法律责任由使用者自负。部分资源可能包含水印或引流信息,请自行甄别。若链接失效可联系站长尝试补链。若侵犯您的权益,请邮件(将 # 替换为 @)至 feedback#tgoos.com,我们将及时处理删除。转载请保留原文链接,感谢支持原创。