VoxCPM:清华系开源语音大模型,30种语言+方言,文本描述即可造声音

· 科技资讯

一、它是什么

2026年4月,清华大学NLP实验室联合面壁智能(ModelBest)的OpenBMB团队,正式开源了VoxCPM2——一款20亿参数的语音大模型。

VoxCPM语音大模型封面

这不是普通的TTS(文本转语音)。VoxCPM2的独特之处在于:它彻底放弃了传统语音合成中的token化步骤,采用端到端的扩散自回归架构,直接在连续潜空间生成语音波形。这意味着它能保留更多人类语音的细微特征——呼吸节奏、音高变化、情绪转折。

核心参数一览:

参数量:2B(20亿),基于MiniCPM-4骨干网络

训练数据:超过200万小时多语种语音

支持语言30种(中英日韩法德西俄阿等)+ 9种中文方言

输出音质48kHz录音室级别,内置AudioVAE V2超分辨率模块

显存需求:最低约8GB,RTX 4090即可流畅运行

推理速度:标准RTF约0.30,Nano-vLLM优化后可达0.13

许可证Apache-2.0,完全开源,可免费商用

二、六大核心能力

VoxCPM2并非”又一个TTS模型”,它的能力矩阵远超市面上多数同类产品。

多语言合成:30种语言一键合成,无需手动指定语言标签,模型自动识别

中文方言支持:四川话、粤语、吴语、东北话、河南话、陕西话、山东话、天津话、闽南话——共9种方言

声音设计(Voice Design):最具差异化的功能。只需一段文字描述,比如「二十多岁的女生,声音温柔带点沙哑」,就能创造出一个从未存在过的全新声音,无需任何参考音频

可控语音克隆(Controllable Cloning):上传一小段音频即可克隆音色,还能通过文本指令调整语速、情绪、风格

极致克隆(Ultimate Cloning):提供参考音频+对应逐字稿,实现最高保真度的声音复制

LoRA微调:仅需5-10分钟的音频素材,即可训练专属声音模型

架构上,VoxCPM2的流水线为:LocEnc → TSLM → RALM → LocDiT,全程在AudioVAE V2潜空间中运行,不经过任何离散token转换。

三、5分钟上手

VoxCPM2支持两种安装方式:PyPI直接安装,或从GitHub源码安装(推荐后者以获取最新特性)。

### 环境要求

– Python ≥ 3.10(< 3.13)

– PyTorch ≥ 2.5.0

– CUDA ≥ 12.0

– NVIDIA GPU(RTX 3060及以上均可)

### 安装

# 方式一:从源码安装(推荐)
git clone https://github.com/OpenBMB/VoxCPM.git
cd VoxCPM
pip install -e .

# 方式二:从PyPI安装
pip install voxcpm

### 基础使用

from voxcpm import VoxCPM

# 加载模型(首次运行自动下载权重)
model = VoxCPM.from_pretrained("openbmb/VoxCPM2")

# 基础文本合成——30种语言自动识别
audio = model.generate("你好,欢迎来到AI语音的新纪元!")
audio.save("output.wav", sample_rate=48000)

### 声音设计(零参考音频创造新声音)

# 格式:(描述文本)要合成的内容
text = "(A warm, deep male voice with a gentle tone) Welcome to the future of voice AI."
audio = model.generate(text)
audio.save("designed_voice.wav", sample_rate=48000)

# 中文示例
text_cn = "(一位二十多岁、声音温柔略带沙哑的女性)今天我们来聊一聊国产AI的最新进展。"
audio_cn = model.generate(text_cn)
audio_cn.save("designed_voice_cn.wav", sample_rate=48000)

### 可控语音克隆

# 上传一段参考音频,克隆音色并控制语速和情绪
audio = model.generate(
    "请用更慢的速度读这句话,语气要温暖一些。",
    reference_wav_path="my_voice.wav",
    instruction="speak slowly with a warm tone",
)
audio.save("cloned_voice.wav", sample_rate=48000)

### 命令行使用

# 基础合成
voxcpm generate "Hello, world!" --output out.wav

# 声音设计
voxcpm generate "(A cheerful young female voice) Good morning!" --output out.wav

# 语音克隆
voxcpm generate "要合成的文本" --reference-wav speaker.wav --instruction "speak faster"

### 启动Web演示界面

python app.py --device auto

### 生产部署(高并发)

# 使用Nano-vLLM引擎,RTF降至0.13,支持并发请求
pip install nano-vllm-voxcpm

四、性能对比

### Seed-TTS-eval 零样本基准

VoxCPM2在权威的Seed-TTS-eval评测中表现出色:

| 模型 | test-EN WER↓ | test-EN SIM↑ | test-ZH CER↓ | test-ZH SIM↑ |

|——|————-|————-|————-|————-|

| VoxCPM2 | 1.84% | 75.3% | 0.97% | 79.5% |

| CosyVoice3 | 2.02% | 71.8% | 1.16% | 78.0% |

| Seed-TTS | 2.25% | 76.2% | 1.12% | 79.6% |

| MegaTTS3 | 2.79% | 77.1% | 1.52% | 79.0% |

| MiniMax-Speech | 1.65% | 69.2% | 0.83% | 78.3% |

> WER/CER越低越好,代表语音清晰度;SIM越高越好,代表声音相似度。

### Minimax-MLS基准(对比商业巨头ElevenLabs)

| 语言 | VoxCPM2 SIM | ElevenLabs SIM | VoxCPM2 WER | ElevenLabs WER |

|——|————|—————-|————-|—————-|

| 英语 | 85.4% | 61.3% | 2.29% | 2.34% |

| 中文 | 82.5% | 67.7% | 1.14% | 16.03% |

| 德语 | 80.3% | 61.4% | 0.68% | 0.57% |

| 阿拉伯语 | 79.1% | 70.6% | 13.05% | 1.67% |

关键解读:在主流语言(中、英、德)上,VoxCPM2在相似度和清晰度两个维度均达到或超越商业付费方案。一个完全免费、本地运行的模型,在核心指标上正面硬刚月费最高1320美元的ElevenLabs Business方案——这是开源语音AI的一个重要时刻。

五、为什么它特别?

VoxCPM2之所以引发社区热议(GitHub已获4,500+ Stars),背后有几点深层原因。

第一,架构创新。绝大多数TTS模型先将语音编码为离散token,再像文本生成一样逐token预测。VoxCPM2的Tokenizer-Free扩散自回归架构跳过了这一步,直接在连续空间建模——这意味着它天然保留了语音中的音高、节奏、呼吸等微妙信息,声音听起来更”像人”。

第二,声音设计——开创新范式。过去做语音合成,要么用预设音色库,要么上传参考音频克隆。VoxCPM2的Voice Design功能完全打破了这个限制:用自然语言描写声音特征,模型帮你创造出来。这不仅是技术突破,更是一种全新的交互范式。

第三,国产自研+完全开源。从清华NLP实验室到OpenBMB,从0.5B的初代VoxCPM到2B的VoxCPM2,这条技术路线完全自主可控。Apache-2.0协议意味着无论是个人开发者还是商业公司,都可以零成本自由使用

第四,方言支持。对中文用户来说,9种方言的支持是巨大的加分项。四川话的有趣、粤语的韵味、东北话的亲切——这些都能直接合成,这在海外商业TTS服务中几乎不可能做到。

六、适合谁

独立开发者 / 小团队:零成本、本地运行、无限生成,替代昂贵的商业TTS API

内容创作者:播客、有声书、视频配音,声音设计功能让每个项目都有独特的声音形象

AI应用开发者:通过vLLM-Omni的OpenAI兼容API(`/v1/audio/speech`),无缝集成到现有AI工作流

方言/多语言项目:30种语言+9种方言的覆盖,在教育和文化保护领域有独特价值

语音研究者:完全开源的架构和权重,是研究Tokenizer-Free TTS的绝佳基座

局限与注意:部分低资源语言(如阿拉伯语、捷克语)的WER偏高,声音设计功能在不同生成之间存在一定变异度(官方建议生成1-3次选取最佳结果),需要在实际场景中自行评估。


> 📦 GitHub仓库:[github.com/OpenBMB/VoxCPM](https://github.com/OpenBMB/VoxCPM)

> 🎧 在线试听:[openbmb.github.io/voxcpm2-demopage](https://openbmb.github.io/voxcpm2-demopage)

> 🤗 HuggingFace模型:[huggingface.co/openbmb/VoxCPM2](https://huggingface.co/openbmb/VoxCPM2)

> 📖 文档:[voxcpm.readthedocs.io](https://voxcpm.readthedocs.io)


— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn

滚动至顶部
微信公众号:LC智趣厅

扫码关注微信公众号
LC智趣厅