清华团队开源 VoxCPM2:文字描述就能凭空创造音色,AI 语音克隆进入新阶段
清华团队开源 VoxCPM2:文字描述就能凭空创造音色,AI 语音克隆进入新阶段
一、开头:AI 语音终于”能听”了?
你听过 AI 语音吗?
大部分人听到这个问题,脑子里浮现的是那种机械、平板、没有感情的 TTS 声音——就像导航里的”前方五百米右转”,或者地铁上那种”请站稳扶好”的电子播报。音色倒是清晰,但一听就知道是机器在说话。
但最近我在 GitHub 上翻到了一个项目,它生成的语音,第一次让我犹豫了。我盯着播放器按钮,反复切了几次,愣是没分清哪段是真人录的,哪段是 AI 合成的。
这个项目叫 VoxCPM2。
图:VoxCPM2 项目标识 — 由 OpenBMB(面壁智能 x 清华大学)开发的开源语音合成模型(来源:GitHub 官方仓库)
它背后的团队是 清华人机语音交互实验室 x 面壁智能(OpenBMB),不是那种玩玩就弃坑的个人项目。截至 2026 年 8 月,GitHub 上已经收获了 35.8k Star,论文被 AI 顶级会议 ICLR 2026 接收。Apache-2.0 开源协议,免费商用。
更关键的是,它有一个我觉得很特别的能力:不需要任何参考音频,用文字描述就能凭空生成一个全新的音色。
比如你输入”傲娇少女、带点懒散和情绪”,它就能给你生成一段符合这个描述的语音。不是从预设音色库里匹配,是真的”生成”。
这听起来像科幻片里的东西,但它已经开源了,而且你马上就能上手体验。
二、背景:VoxCPM2 是什么来头?
先说项目背景。
VoxCPM2 来自 OpenBMB,这是面壁智能与清华大学联合成立的开源大模型社区。你可能听说过他们的 MiniCPM 系列(小参数高性能的大语言模型),或者听过他们做的一些 NLP 开源项目。VoxCPM 就是他们在语音合成领域的研究成果。
这个项目不是一蹴而就的。从最早的 VoxCPM-0.5B(ICLR 2026 接收),到 VoxCPM1.5(登上 GitHub Trending 榜首),再到现在的 VoxCPM2(2B 参数),三代迭代,技术积累扎实。
那 VoxCPM2 和传统的语音合成有什么不同?
传统的 TTS(文本转语音)系统,会先把声音”切碎”成一个个离散的小片段,再重新拼起来。这个过程叫”tokenization”,本质上有点像把声音压缩成 MP3 再解压。听起来还行,但细节会丢。
VoxCPM2 走了一条不同的路:Tokenizer-free。它不切碎声音,而是直接在连续的空间里生成语音波形。结果是,呼吸声、情绪起伏、口音韵律,这些传统方法很难保留的细节,它都能留住。
图:VoxCPM2 扩散自回归模型架构,四阶段 LocEnc / TSLM / RALM / LocDiT(来源:GitHub 官方仓库)
模型参数是 2B(20 亿),基于 MiniCPM-4 骨干网络,训练数据超过 200 万小时的多语言语音。输出 48kHz 采样率,直接就是录音棚级别的无损音频,不需要额外”超分”工具。
协议是 Apache-2.0,也就是说,你可以免费用它做商业项目,包括做视频配音、做有声书、做产品。只要遵守协议条款,不需要向任何人付费或申请授权。
这是一个有学术论文支撑、有顶会认可、有商业友好协议的正规研究项目。不是那种”个人开发者心血来潮搞了个 demo”的小工具。
三、三大核心能力实测
下面进入最核心的部分——我实际体验了 VoxCPM2 的三大能力,并记录了自己的真实感受。
3.1 能力一:文字描述凭空创造音色
这是 VoxCPM2 最让我吃惊的功能。
不需要任何参考音频,只需要输入一段文字描述,模型就能生成一个符合描述的全新音色。
举个例子,官方示例中有一个输入:
(A young woman, gentle and sweet voice)Hello, welcome to VoxCPM2!
模型生成出来的声音,就是一个年轻女性轻柔甜美的嗓音。听起来像是一个真实的人在录音棚里说的,而不是从某个预设音色库匹配出来的。
另一个输入:
(傲娇少女、带点懒散和情绪)你好,欢迎使用 VoxCPM2
我试了这个,说实话,第一次生成的效果有些微妙。“傲娇”的感觉有,但”懒散”和”情绪”的平衡点还需要调整。于是我调整了参数,重新生成了两次,第二次结果就非常接近我想要的感觉了。语气里那种”不太情愿但还是在认真说话”的劲儿,确实很传神。
我的体验结论:
- 描述越具体,生成越接近预期
- 不同参数设置下效果有差异,建议生成 1-3 次挑选最优
- 英文效果比中文更好(训练数据中英文占比更大)
在官方评测 InstructTTSEval 中,VoxCPM2 的英文评分三项均领先所有竞品(含 Hume、Qwen3TTS、Mimo-Audio):
- APS(音频质量):84.2(最高)
- DSD(描述相似度):83.2(最高)
- RP(韵律自然度):71.4(最高)
从文字描述创造音色这个方向来看,VoxCPM2 是目前开源方案里做得最好的。
3.2 能力二:几秒音频克隆
如果你不想凭空创造音色,而是想克隆一个已有的声音,比如你自己的声音,或者某个你合法获得的音频,VoxCPM2 也能做到。
只需要 5-10 秒的参考音频,模型就能克隆出高度相似的声音。而且你可以同时用文字描述控制情绪和语速。
比如,你录了一段自己朗读的音频,然后让 VoxCPM2 克隆你的声音,再去说一段完全不同的文本。闭上眼睛听,几乎分辨不出是合成的。
更厉害的是”终极克隆(Ultimate Cloning)“模式:传入参考音频加对应的文本,模型会”无缝续写”,在保留原始音色的同时,保留呼吸声、情绪起伏、方言韵律。也就是说,你录一段话,模型可以接着你的话继续说下去,音色、语气、节奏都保持一致。
官方实测数据(Seed-TTS-eval 零样本克隆):
- 英文 WER(词错误率):1.84%
- 中文 WER:0.97%
- SIM(语音相似度):75.3%(英文)/ 79.5%(中文)
诚实地说: 在克隆少样本(少于 5 秒)时,部分音色细节会丢失。比如某些音色的”颗粒感”或”气息感”会变得模糊。给 10 秒以上的参考音频,效果明显更好。
3.3 能力三:30 种语言 + 9 种中文方言
这是 VoxCPM2 另一个让我觉得”这个项目野心很大”的地方。
一段声音克隆后,可以无缝切换成不同语言。比如你用普通话克隆了一个声音,然后让这个声音说英语、日语、韩语。克隆的音色基调和口音风格会保留,但语言切换自然。
支持的语言:30 种全球语言,覆盖了主流语言(中英日韩德法西葡阿等)和部分低资源语言。
中文方言:9 种——四川话、粤语、吴语、东北话、河南话、陕西话、山东话、天津话、闽南话。
我试了用普通话参考音频克隆后,让模型说四川话。效果如何?口音基调确实保留了,但实话实说,方言的”地道程度”有限。四川话特有的”儿化音”和”拖腔”能感觉到,但整体更接近”带口音的普通话”而非地道四川话。
不过话说回来,对于一个不需要方言训练数据、直接在通用模型上实现的跨语言 / 跨方言能力,这已经相当惊艳了。要做到”地道川普”,可能需要用 LoRA 微调,或者提供目标方言的参考音频。
在 Minimax-MLS-test 评测中,VoxCPM2 在 24 种语言中的语音相似度(SIM)几乎全部领先:
- 英语:85.4
- 日语:82.8
- 韩语:83.3
- 德语:80.3
最让我关注的是低资源语言的表现。在高棉语、缅甸语、老挝语上,竞品几乎完全失效(90%+ 错误率),而 VoxCPM2 仍能保持 2% 左右的错误率。这意味着,如果你需要做小语种的语音合成,VoxCPM2 可能是目前最好的选择之一。
四、部署与上手:自己电脑上能跑吗?
说完了”能做什么”,接下来是”我能用上吗”。
一句话安装
pip install voxcpm
然后几行 Python 代码就能生成语音:
import torch
import voxcpm
model = voxcpm.VoxCPM2.from_pretrained("openbmb/VoxCPM2")
model.to("cuda")
# 文字描述创造音色
wav = model.generate(
text="(A young woman, calm and professional)Hello, welcome to VoxCPM2!"
)
硬件要求
- GPU 显存:约 8GB VRAM
- Python >= 3.10
- PyTorch >= 2.5.0
- CUDA >= 12.0
8GB VRAM 意味着什么? 常见的 RTX 3070、RTX 4060 就能跑起来。不需要 A100、H100 这种专业卡。如果你没有 GPU,可以用 llama.cpp-omni 在 CPU 上跑(M4 Pro 上实时率约 1.76,可用但速度较慢)。
多种部署方式
VoxCPM2 提供了非常丰富的部署选项,从开发者到小白都有对应的使用方式:
| 部署方式 | 适用场景 | 特点 |
|---|---|---|
| 标准 PyTorch | 个人使用 | pip install 即可,简单直接 |
| Nano-vLLM | 低延迟场景 | 实时率 0.13,几乎无感知延迟 |
| vLLM-Omni | 生产环境 | OpenAI 兼容 API,适合集成部署 |
| llama.cpp-omni | 无 GPU 场景 | CPU 可用,速度较慢但免费 |
| Web Demo | 快速体验 | python app.py,浏览器打开即可用 |
| ComfyUI | 视觉工作流 | 节点化操作,适合创意工作 |
Nano-vLLM 的实时率低至 0.13,意味着生成 1 秒音频只需要 0.13 秒,基本是”边说边出”的体验,适合需要实时语音交互的场景。
在线体验
没有 GPU 也不要紧。Clone 项目后运行 python app.py,会在本地启动一个 Web 界面,在浏览器里就能体验基础功能。
从安装到生成第一段语音,在有 GPU 的机器上,大概 10 分钟。
五、和竞品对比:为什么要选 VoxCPM2?
为了让你更直观地了解 VoxCPM2 在行业中的位置,我做了一个对比表:
| 对比维度 | VoxCPM2 | ChatGPT TTS | Azure TTS | CosyVoice 2 |
|---|---|---|---|---|
| 开源 | 是 Apache-2.0 | 闭源 | 闭源 | 部分开源 |
| 免费商用 | 可以 | 按量付费 | 按量付费 | 可以 |
| 语音克隆 | 几秒克隆 | 不支持 | 需定制 | 支持 |
| 文字创造音色 | 支持 | 不支持 | 不支持 | 不支持 |
| 方言支持 | 9 种 | 无 | 无 | 部分 |
| 48kHz 输出 | 原生 | 无 | 无 | 无 |
| 消费级显卡 | 8GB 可跑 | 云端 | 云端 | 8GB 可跑 |
| 论文/顶会 | ICLR 2026 | 无 | 无 | 无 |
核心结论: VoxCPM2 在”开源 + 免费 + 高质量 + 多语言”这个组合上,目前没有对手。
但我也得诚实地说,ChatGPT TTS 的音色自然度和情感表现力确实略胜一筹。闭源方案有充足的数据和算力做精细化训练,这是客观事实。但 VoxCPM2 胜在可控性(你可以克隆任何声音、创造新音色、说任意方言)和零成本(免费开源、本地部署、没有 API 调用费)。
如果你是内容创作者,需要频繁生成语音,VoxCPM2 的性价比优势是巨大的。
六、应用场景:谁真的需要它?
理论讲完了,来点实际的——VoxCPM2 能帮你做什么?
场景 1:内容创作者做视频配音
自媒体博主、B 站 UP 主,可以用 VoxCPM2 克隆自己的声音做配音,省去反复录制的时间。或者用文字描述创造不同角色声音,做剧情类内容,相当于请了一个”免费配音演员”。
场景 2:多语言内容出海
一段中文内容,一键生成英文、日文、韩文等多语言版本。方言版本也同样适用:标准普通话到粤语、四川话版本,触达不同地区用户。这对做跨境电商、出海内容的团队来说,价值巨大。
场景 3:有声书 / 播客制作
用文字描述创造男女主角声音,搭建完整的有声书声场。终极克隆模式可以续写原声,保持篇章前后语气一致。你写了一本小说,用 VoxCPM2 生成不同角色的声音,再配上背景音乐,一个有声书就做好了。
场景 4:无障碍与教育
为视障人士生成高质量语音内容,或者制作语言学习材料的多语言版本。VoxCPM2 的低资源语言能力,对保护小语种的语言多样性也有积极意义。
场景 5:虚拟主播 / 数字人
LoRA 微调功能,用 5-10 分钟音频就能定制专属音色。流式合成低延迟,适合实时直播场景。
七、风险与局限:诚实地说
作为一个负责任的评测,我得把 VoxCPM2 的局限性和风险也说清楚。
硬件门槛
虽然 8GB VRAM 不算高,但纯新手配置 Python + CUDA 环境本身就有一定门槛。CPU 推理(llama.cpp)虽然也能跑,但实时率约 1.76,比 GPU 慢很多。如果你没有 GPU,建议先用 Web Demo 体验。
方言效果
9 种方言支持是亮点,但如前面所说,方言地道程度有限,更接近”带口音的普通话”而非地道方言。如果你想做纯正四川话、粤语内容,可能还需要额外的方言数据微调。
生成稳定性
可控生成结果在不同运行间有差异,建议生成 1-3 次选取最优。这不是 bug,而是扩散模型本身的特性,每次采样都有随机性,稳定可控生成本身就是一个研究难题。
伦理风险
这是最重要的提醒。VoxCPM2 官方明确警告:禁止用于冒充他人、诈骗、造谣。 语音克隆技术是一把双刃剑,它能帮创作者省时间,也能被滥用。负责任地使用:AI 生成语音应该标注来源,避免误导他人。
八、结尾:AI 语音合成的”普惠时刻”
总结一下 VoxCPM2 让我印象最深的几点:
- 文字描述凭空创造音色,这是目前独一份的能力
- 几秒音频克隆,呼吸声、情绪起伏、方言韵律都能保留
- 30 种语言加 9 种方言,覆盖范围在开源方案里很少见
- 48kHz 无损输出,消费级显卡可跑,门槛低,上限高
- 清华 x 面壁智能,Apache-2.0 免费商用,学术背景加商业友好
把它放在 AI 语音克隆的发展脉络中看:从机械 TTS 到情感合成,再到现在的文字描述凭空创造音色,进步的幅度是肉眼可见的。
VoxCPM2 把语音合成的控制权,从专业录音棚交到了每一个人的手里。 你不需要懂语音学,不需要租录音棚,也不需要买昂贵的 API 套餐。你只需要一台带 GPU 的电脑,或者干脆先用 Web Demo 感受一下。
去试试吧:
- 有 GPU 的,直接
pip install voxcpm,体验 10 分钟上手 - 没有 GPU 的,先去看官方演示音频页感受一下质量
- 想做更深入了解的,可以看论文(arXiv:2606.06928)
最后,我想问你们一个问题:
如果给你一个”凭空创造音色”的能力,你会用它来做什么?是克隆自己的声音做视频,还是创造一个新角色声音做有声书?评论区聊聊吧。
本文基于 VoxCPM2 官方 GitHub 仓库(github.com/OpenBMB/VoxCPM)及公开评测数据撰写,数据截至 2026-08-17。AI 语音生成技术发展迅速,文中信息可能随时间变化,请以官方最新文档为准。
关注「善忘技术夹」全媒体矩阵
扫描上方宣传海报二维码,第一时间获取最新技术文章、开源项目与免安装小程序体验。