VoxCPM:清华系开源语音大模型,30种语言+方言,文本描述即可造声音
一、它是什么
2026年4月,清华大学NLP实验室联合面壁智能(ModelBest)的OpenBMB团队,正式开源了VoxCPM2——一款20亿参数的语音大模型。

这不是普通的TTS(文本转语音)。VoxCPM2的独特之处在于:它彻底放弃了传统语音合成中的token化步骤,采用端到端的扩散自回归架构,直接在连续潜空间生成语音波形。这意味着它能保留更多人类语音的细微特征——呼吸节奏、音高变化、情绪转折。
核心参数一览:
– 参数量:2B(20亿),基于MiniCPM-4骨干网络
– 训练数据:超过200万小时多语种语音
– 支持语言:30种(中英日韩法德西俄阿等)+ 9种中文方言
– 输出音质:48kHz录音室级别,内置AudioVAE V2超分辨率模块
– 显存需求:最低约8GB,RTX 4090即可流畅运行
– 推理速度:标准RTF约0.30,Nano-vLLM优化后可达0.13
– 许可证:Apache-2.0,完全开源,可免费商用
二、六大核心能力
VoxCPM2并非”又一个TTS模型”,它的能力矩阵远超市面上多数同类产品。
– 多语言合成:30种语言一键合成,无需手动指定语言标签,模型自动识别
– 中文方言支持:四川话、粤语、吴语、东北话、河南话、陕西话、山东话、天津话、闽南话——共9种方言
– 声音设计(Voice Design):最具差异化的功能。只需一段文字描述,比如「二十多岁的女生,声音温柔带点沙哑」,就能创造出一个从未存在过的全新声音,无需任何参考音频
– 可控语音克隆(Controllable Cloning):上传一小段音频即可克隆音色,还能通过文本指令调整语速、情绪、风格
– 极致克隆(Ultimate Cloning):提供参考音频+对应逐字稿,实现最高保真度的声音复制
– LoRA微调:仅需5-10分钟的音频素材,即可训练专属声音模型
架构上,VoxCPM2的流水线为:LocEnc → TSLM → RALM → LocDiT,全程在AudioVAE V2潜空间中运行,不经过任何离散token转换。
三、5分钟上手
VoxCPM2支持两种安装方式:PyPI直接安装,或从GitHub源码安装(推荐后者以获取最新特性)。
### 环境要求
– Python ≥ 3.10(< 3.13)
– PyTorch ≥ 2.5.0
– CUDA ≥ 12.0
– NVIDIA GPU(RTX 3060及以上均可)
### 安装
# 方式一:从源码安装(推荐)
git clone https://github.com/OpenBMB/VoxCPM.git
cd VoxCPM
pip install -e .
# 方式二:从PyPI安装
pip install voxcpm### 基础使用
from voxcpm import VoxCPM
# 加载模型(首次运行自动下载权重)
model = VoxCPM.from_pretrained("openbmb/VoxCPM2")
# 基础文本合成——30种语言自动识别
audio = model.generate("你好,欢迎来到AI语音的新纪元!")
audio.save("output.wav", sample_rate=48000)### 声音设计(零参考音频创造新声音)
# 格式:(描述文本)要合成的内容
text = "(A warm, deep male voice with a gentle tone) Welcome to the future of voice AI."
audio = model.generate(text)
audio.save("designed_voice.wav", sample_rate=48000)
# 中文示例
text_cn = "(一位二十多岁、声音温柔略带沙哑的女性)今天我们来聊一聊国产AI的最新进展。"
audio_cn = model.generate(text_cn)
audio_cn.save("designed_voice_cn.wav", sample_rate=48000)### 可控语音克隆
# 上传一段参考音频,克隆音色并控制语速和情绪
audio = model.generate(
"请用更慢的速度读这句话,语气要温暖一些。",
reference_wav_path="my_voice.wav",
instruction="speak slowly with a warm tone",
)
audio.save("cloned_voice.wav", sample_rate=48000)### 命令行使用
# 基础合成
voxcpm generate "Hello, world!" --output out.wav
# 声音设计
voxcpm generate "(A cheerful young female voice) Good morning!" --output out.wav
# 语音克隆
voxcpm generate "要合成的文本" --reference-wav speaker.wav --instruction "speak faster"### 启动Web演示界面
python app.py --device auto### 生产部署(高并发)
# 使用Nano-vLLM引擎,RTF降至0.13,支持并发请求
pip install nano-vllm-voxcpm四、性能对比
### Seed-TTS-eval 零样本基准
VoxCPM2在权威的Seed-TTS-eval评测中表现出色:
| 模型 | test-EN WER↓ | test-EN SIM↑ | test-ZH CER↓ | test-ZH SIM↑ |
|——|————-|————-|————-|————-|
| VoxCPM2 | 1.84% | 75.3% | 0.97% | 79.5% |
| CosyVoice3 | 2.02% | 71.8% | 1.16% | 78.0% |
| Seed-TTS | 2.25% | 76.2% | 1.12% | 79.6% |
| MegaTTS3 | 2.79% | 77.1% | 1.52% | 79.0% |
| MiniMax-Speech | 1.65% | 69.2% | 0.83% | 78.3% |
> WER/CER越低越好,代表语音清晰度;SIM越高越好,代表声音相似度。
### Minimax-MLS基准(对比商业巨头ElevenLabs)
| 语言 | VoxCPM2 SIM | ElevenLabs SIM | VoxCPM2 WER | ElevenLabs WER |
|——|————|—————-|————-|—————-|
| 英语 | 85.4% | 61.3% | 2.29% | 2.34% |
| 中文 | 82.5% | 67.7% | 1.14% | 16.03% |
| 德语 | 80.3% | 61.4% | 0.68% | 0.57% |
| 阿拉伯语 | 79.1% | 70.6% | 13.05% | 1.67% |
关键解读:在主流语言(中、英、德)上,VoxCPM2在相似度和清晰度两个维度均达到或超越商业付费方案。一个完全免费、本地运行的模型,在核心指标上正面硬刚月费最高1320美元的ElevenLabs Business方案——这是开源语音AI的一个重要时刻。
五、为什么它特别?
VoxCPM2之所以引发社区热议(GitHub已获4,500+ Stars),背后有几点深层原因。
第一,架构创新。绝大多数TTS模型先将语音编码为离散token,再像文本生成一样逐token预测。VoxCPM2的Tokenizer-Free扩散自回归架构跳过了这一步,直接在连续空间建模——这意味着它天然保留了语音中的音高、节奏、呼吸等微妙信息,声音听起来更”像人”。
第二,声音设计——开创新范式。过去做语音合成,要么用预设音色库,要么上传参考音频克隆。VoxCPM2的Voice Design功能完全打破了这个限制:用自然语言描写声音特征,模型帮你创造出来。这不仅是技术突破,更是一种全新的交互范式。
第三,国产自研+完全开源。从清华NLP实验室到OpenBMB,从0.5B的初代VoxCPM到2B的VoxCPM2,这条技术路线完全自主可控。Apache-2.0协议意味着无论是个人开发者还是商业公司,都可以零成本自由使用。
第四,方言支持。对中文用户来说,9种方言的支持是巨大的加分项。四川话的有趣、粤语的韵味、东北话的亲切——这些都能直接合成,这在海外商业TTS服务中几乎不可能做到。
六、适合谁
– 独立开发者 / 小团队:零成本、本地运行、无限生成,替代昂贵的商业TTS API
– 内容创作者:播客、有声书、视频配音,声音设计功能让每个项目都有独特的声音形象
– AI应用开发者:通过vLLM-Omni的OpenAI兼容API(`/v1/audio/speech`),无缝集成到现有AI工作流
– 方言/多语言项目:30种语言+9种方言的覆盖,在教育和文化保护领域有独特价值
– 语音研究者:完全开源的架构和权重,是研究Tokenizer-Free TTS的绝佳基座
局限与注意:部分低资源语言(如阿拉伯语、捷克语)的WER偏高,声音设计功能在不同生成之间存在一定变异度(官方建议生成1-3次选取最佳结果),需要在实际场景中自行评估。
> 📦 GitHub仓库:[github.com/OpenBMB/VoxCPM](https://github.com/OpenBMB/VoxCPM)
> 🎧 在线试听:[openbmb.github.io/voxcpm2-demopage](https://openbmb.github.io/voxcpm2-demopage)
> 🤗 HuggingFace模型:[huggingface.co/openbmb/VoxCPM2](https://huggingface.co/openbmb/VoxCPM2)
> 📖 文档:[voxcpm.readthedocs.io](https://voxcpm.readthedocs.io)
— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn
