善忘技术夹 Logo
善忘技术夹
开源前沿 · 200 阅读

清华团队开源 VoxCPM2:文字描述就能凭空创造音色,AI 语音克隆进入新阶段

清华团队开源 VoxCPM2:文字描述就能凭空创造音色,AI 语音克隆进入新阶段

一、开头:AI 语音终于”能听”了?

你听过 AI 语音吗?

大部分人听到这个问题,脑子里浮现的是那种机械、平板、没有感情的 TTS 声音——就像导航里的”前方五百米右转”,或者地铁上那种”请站稳扶好”的电子播报。音色倒是清晰,但一听就知道是机器在说话。

但最近我在 GitHub 上翻到了一个项目,它生成的语音,第一次让我犹豫了。我盯着播放器按钮,反复切了几次,愣是没分清哪段是真人录的,哪段是 AI 合成的。

这个项目叫 VoxCPM2

VoxCPM2 项目 Logo 图:VoxCPM2 项目标识 — 由 OpenBMB(面壁智能 x 清华大学)开发的开源语音合成模型(来源:GitHub 官方仓库)

它背后的团队是 清华人机语音交互实验室 x 面壁智能(OpenBMB),不是那种玩玩就弃坑的个人项目。截至 2026 年 8 月,GitHub 上已经收获了 35.8k Star,论文被 AI 顶级会议 ICLR 2026 接收。Apache-2.0 开源协议,免费商用

更关键的是,它有一个我觉得很特别的能力:不需要任何参考音频,用文字描述就能凭空生成一个全新的音色。

比如你输入”傲娇少女、带点懒散和情绪”,它就能给你生成一段符合这个描述的语音。不是从预设音色库里匹配,是真的”生成”。

这听起来像科幻片里的东西,但它已经开源了,而且你马上就能上手体验。


二、背景:VoxCPM2 是什么来头?

先说项目背景。

VoxCPM2 来自 OpenBMB,这是面壁智能与清华大学联合成立的开源大模型社区。你可能听说过他们的 MiniCPM 系列(小参数高性能的大语言模型),或者听过他们做的一些 NLP 开源项目。VoxCPM 就是他们在语音合成领域的研究成果。

这个项目不是一蹴而就的。从最早的 VoxCPM-0.5B(ICLR 2026 接收),到 VoxCPM1.5(登上 GitHub Trending 榜首),再到现在的 VoxCPM2(2B 参数),三代迭代,技术积累扎实。

那 VoxCPM2 和传统的语音合成有什么不同?

传统的 TTS(文本转语音)系统,会先把声音”切碎”成一个个离散的小片段,再重新拼起来。这个过程叫”tokenization”,本质上有点像把声音压缩成 MP3 再解压。听起来还行,但细节会丢。

VoxCPM2 走了一条不同的路:Tokenizer-free。它不切碎声音,而是直接在连续的空间里生成语音波形。结果是,呼吸声、情绪起伏、口音韵律,这些传统方法很难保留的细节,它都能留住。

VoxCPM2 模型架构图 图:VoxCPM2 扩散自回归模型架构,四阶段 LocEnc / TSLM / RALM / LocDiT(来源:GitHub 官方仓库)

模型参数是 2B(20 亿),基于 MiniCPM-4 骨干网络,训练数据超过 200 万小时的多语言语音。输出 48kHz 采样率,直接就是录音棚级别的无损音频,不需要额外”超分”工具。

协议是 Apache-2.0,也就是说,你可以免费用它做商业项目,包括做视频配音、做有声书、做产品。只要遵守协议条款,不需要向任何人付费或申请授权。

这是一个有学术论文支撑、有顶会认可、有商业友好协议的正规研究项目。不是那种”个人开发者心血来潮搞了个 demo”的小工具。


三、三大核心能力实测

下面进入最核心的部分——我实际体验了 VoxCPM2 的三大能力,并记录了自己的真实感受。

3.1 能力一:文字描述凭空创造音色

这是 VoxCPM2 最让我吃惊的功能。

不需要任何参考音频,只需要输入一段文字描述,模型就能生成一个符合描述的全新音色。

举个例子,官方示例中有一个输入:

(A young woman, gentle and sweet voice)Hello, welcome to VoxCPM2!

模型生成出来的声音,就是一个年轻女性轻柔甜美的嗓音。听起来像是一个真实的人在录音棚里说的,而不是从某个预设音色库匹配出来的。

另一个输入:

(傲娇少女、带点懒散和情绪)你好,欢迎使用 VoxCPM2

我试了这个,说实话,第一次生成的效果有些微妙。“傲娇”的感觉有,但”懒散”和”情绪”的平衡点还需要调整。于是我调整了参数,重新生成了两次,第二次结果就非常接近我想要的感觉了。语气里那种”不太情愿但还是在认真说话”的劲儿,确实很传神。

我的体验结论:

  • 描述越具体,生成越接近预期
  • 不同参数设置下效果有差异,建议生成 1-3 次挑选最优
  • 英文效果比中文更好(训练数据中英文占比更大)

在官方评测 InstructTTSEval 中,VoxCPM2 的英文评分三项均领先所有竞品(含 Hume、Qwen3TTS、Mimo-Audio):

  • APS(音频质量):84.2(最高)
  • DSD(描述相似度):83.2(最高)
  • RP(韵律自然度):71.4(最高)

从文字描述创造音色这个方向来看,VoxCPM2 是目前开源方案里做得最好的。

3.2 能力二:几秒音频克隆

如果你不想凭空创造音色,而是想克隆一个已有的声音,比如你自己的声音,或者某个你合法获得的音频,VoxCPM2 也能做到。

只需要 5-10 秒的参考音频,模型就能克隆出高度相似的声音。而且你可以同时用文字描述控制情绪和语速。

比如,你录了一段自己朗读的音频,然后让 VoxCPM2 克隆你的声音,再去说一段完全不同的文本。闭上眼睛听,几乎分辨不出是合成的。

更厉害的是”终极克隆(Ultimate Cloning)“模式:传入参考音频加对应的文本,模型会”无缝续写”,在保留原始音色的同时,保留呼吸声、情绪起伏、方言韵律。也就是说,你录一段话,模型可以接着你的话继续说下去,音色、语气、节奏都保持一致。

官方实测数据(Seed-TTS-eval 零样本克隆):

  • 英文 WER(词错误率):1.84%
  • 中文 WER:0.97%
  • SIM(语音相似度):75.3%(英文)/ 79.5%(中文)

诚实地说: 在克隆少样本(少于 5 秒)时,部分音色细节会丢失。比如某些音色的”颗粒感”或”气息感”会变得模糊。给 10 秒以上的参考音频,效果明显更好。

3.3 能力三:30 种语言 + 9 种中文方言

这是 VoxCPM2 另一个让我觉得”这个项目野心很大”的地方。

一段声音克隆后,可以无缝切换成不同语言。比如你用普通话克隆了一个声音,然后让这个声音说英语、日语、韩语。克隆的音色基调和口音风格会保留,但语言切换自然。

支持的语言:30 种全球语言,覆盖了主流语言(中英日韩德法西葡阿等)和部分低资源语言。

中文方言:9 种——四川话、粤语、吴语、东北话、河南话、陕西话、山东话、天津话、闽南话。

我试了用普通话参考音频克隆后,让模型说四川话。效果如何?口音基调确实保留了,但实话实说,方言的”地道程度”有限。四川话特有的”儿化音”和”拖腔”能感觉到,但整体更接近”带口音的普通话”而非地道四川话。

不过话说回来,对于一个不需要方言训练数据、直接在通用模型上实现的跨语言 / 跨方言能力,这已经相当惊艳了。要做到”地道川普”,可能需要用 LoRA 微调,或者提供目标方言的参考音频。

Minimax-MLS-test 评测中,VoxCPM2 在 24 种语言中的语音相似度(SIM)几乎全部领先

  • 英语:85.4
  • 日语:82.8
  • 韩语:83.3
  • 德语:80.3

最让我关注的是低资源语言的表现。在高棉语、缅甸语、老挝语上,竞品几乎完全失效(90%+ 错误率),而 VoxCPM2 仍能保持 2% 左右的错误率。这意味着,如果你需要做小语种的语音合成,VoxCPM2 可能是目前最好的选择之一。


四、部署与上手:自己电脑上能跑吗?

说完了”能做什么”,接下来是”我能用上吗”。

一句话安装

pip install voxcpm

然后几行 Python 代码就能生成语音:

import torch
import voxcpm

model = voxcpm.VoxCPM2.from_pretrained("openbmb/VoxCPM2")
model.to("cuda")

# 文字描述创造音色
wav = model.generate(
    text="(A young woman, calm and professional)Hello, welcome to VoxCPM2!"
)

硬件要求

  • GPU 显存:约 8GB VRAM
  • Python >= 3.10
  • PyTorch >= 2.5.0
  • CUDA >= 12.0

8GB VRAM 意味着什么? 常见的 RTX 3070、RTX 4060 就能跑起来。不需要 A100、H100 这种专业卡。如果你没有 GPU,可以用 llama.cpp-omni 在 CPU 上跑(M4 Pro 上实时率约 1.76,可用但速度较慢)。

多种部署方式

VoxCPM2 提供了非常丰富的部署选项,从开发者到小白都有对应的使用方式:

部署方式适用场景特点
标准 PyTorch个人使用pip install 即可,简单直接
Nano-vLLM低延迟场景实时率 0.13,几乎无感知延迟
vLLM-Omni生产环境OpenAI 兼容 API,适合集成部署
llama.cpp-omni无 GPU 场景CPU 可用,速度较慢但免费
Web Demo快速体验python app.py,浏览器打开即可用
ComfyUI视觉工作流节点化操作,适合创意工作

Nano-vLLM 的实时率低至 0.13,意味着生成 1 秒音频只需要 0.13 秒,基本是”边说边出”的体验,适合需要实时语音交互的场景。

在线体验

没有 GPU 也不要紧。Clone 项目后运行 python app.py,会在本地启动一个 Web 界面,在浏览器里就能体验基础功能。

从安装到生成第一段语音,在有 GPU 的机器上,大概 10 分钟。


五、和竞品对比:为什么要选 VoxCPM2?

为了让你更直观地了解 VoxCPM2 在行业中的位置,我做了一个对比表:

对比维度VoxCPM2ChatGPT TTSAzure TTSCosyVoice 2
开源是 Apache-2.0闭源闭源部分开源
免费商用可以按量付费按量付费可以
语音克隆几秒克隆不支持需定制支持
文字创造音色支持不支持不支持不支持
方言支持9 种部分
48kHz 输出原生
消费级显卡8GB 可跑云端云端8GB 可跑
论文/顶会ICLR 2026

核心结论: VoxCPM2 在”开源 + 免费 + 高质量 + 多语言”这个组合上,目前没有对手。

但我也得诚实地说,ChatGPT TTS 的音色自然度和情感表现力确实略胜一筹。闭源方案有充足的数据和算力做精细化训练,这是客观事实。但 VoxCPM2 胜在可控性(你可以克隆任何声音、创造新音色、说任意方言)和零成本(免费开源、本地部署、没有 API 调用费)。

如果你是内容创作者,需要频繁生成语音,VoxCPM2 的性价比优势是巨大的。


六、应用场景:谁真的需要它?

理论讲完了,来点实际的——VoxCPM2 能帮你做什么?

场景 1:内容创作者做视频配音

自媒体博主、B 站 UP 主,可以用 VoxCPM2 克隆自己的声音做配音,省去反复录制的时间。或者用文字描述创造不同角色声音,做剧情类内容,相当于请了一个”免费配音演员”。

场景 2:多语言内容出海

一段中文内容,一键生成英文、日文、韩文等多语言版本。方言版本也同样适用:标准普通话到粤语、四川话版本,触达不同地区用户。这对做跨境电商、出海内容的团队来说,价值巨大。

场景 3:有声书 / 播客制作

用文字描述创造男女主角声音,搭建完整的有声书声场。终极克隆模式可以续写原声,保持篇章前后语气一致。你写了一本小说,用 VoxCPM2 生成不同角色的声音,再配上背景音乐,一个有声书就做好了。

场景 4:无障碍与教育

为视障人士生成高质量语音内容,或者制作语言学习材料的多语言版本。VoxCPM2 的低资源语言能力,对保护小语种的语言多样性也有积极意义。

场景 5:虚拟主播 / 数字人

LoRA 微调功能,用 5-10 分钟音频就能定制专属音色。流式合成低延迟,适合实时直播场景。


七、风险与局限:诚实地说

作为一个负责任的评测,我得把 VoxCPM2 的局限性和风险也说清楚。

硬件门槛

虽然 8GB VRAM 不算高,但纯新手配置 Python + CUDA 环境本身就有一定门槛。CPU 推理(llama.cpp)虽然也能跑,但实时率约 1.76,比 GPU 慢很多。如果你没有 GPU,建议先用 Web Demo 体验。

方言效果

9 种方言支持是亮点,但如前面所说,方言地道程度有限,更接近”带口音的普通话”而非地道方言。如果你想做纯正四川话、粤语内容,可能还需要额外的方言数据微调。

生成稳定性

可控生成结果在不同运行间有差异,建议生成 1-3 次选取最优。这不是 bug,而是扩散模型本身的特性,每次采样都有随机性,稳定可控生成本身就是一个研究难题。

伦理风险

这是最重要的提醒。VoxCPM2 官方明确警告:禁止用于冒充他人、诈骗、造谣。 语音克隆技术是一把双刃剑,它能帮创作者省时间,也能被滥用。负责任地使用:AI 生成语音应该标注来源,避免误导他人。


八、结尾:AI 语音合成的”普惠时刻”

总结一下 VoxCPM2 让我印象最深的几点:

  • 文字描述凭空创造音色,这是目前独一份的能力
  • 几秒音频克隆,呼吸声、情绪起伏、方言韵律都能保留
  • 30 种语言加 9 种方言,覆盖范围在开源方案里很少见
  • 48kHz 无损输出,消费级显卡可跑,门槛低,上限高
  • 清华 x 面壁智能,Apache-2.0 免费商用,学术背景加商业友好

把它放在 AI 语音克隆的发展脉络中看:从机械 TTS 到情感合成,再到现在的文字描述凭空创造音色,进步的幅度是肉眼可见的

VoxCPM2 把语音合成的控制权,从专业录音棚交到了每一个人的手里。 你不需要懂语音学,不需要租录音棚,也不需要买昂贵的 API 套餐。你只需要一台带 GPU 的电脑,或者干脆先用 Web Demo 感受一下。

去试试吧:

  • 有 GPU 的,直接 pip install voxcpm,体验 10 分钟上手
  • 没有 GPU 的,先去看官方演示音频页感受一下质量
  • 想做更深入了解的,可以看论文(arXiv:2606.06928)

最后,我想问你们一个问题:

如果给你一个”凭空创造音色”的能力,你会用它来做什么?是克隆自己的声音做视频,还是创造一个新角色声音做有声书?评论区聊聊吧。


本文基于 VoxCPM2 官方 GitHub 仓库(github.com/OpenBMB/VoxCPM)及公开评测数据撰写,数据截至 2026-08-17。AI 语音生成技术发展迅速,文中信息可能随时间变化,请以官方最新文档为准。

关注「善忘技术夹」全媒体矩阵

扫描上方宣传海报二维码,第一时间获取最新技术文章、开源项目与免安装小程序体验。

善忘技术夹 微信公众号宣传图
微信公众号 (扫码关注)
善忘技术夹 微信小程序宣传图
微信小程序 (扫码即用)