开源前沿 · 200 阅读
清华团队开源 VoxCPM2:文字描述就能凭空创造音色,AI 语音克隆进入新阶段
VoxCPM2 是清华 x 面壁智能(OpenBMB)开源的语音合成模型,2B 参数、200 万小时训练数据、48kHz 无损输出。支持文字描述凭空创造音色、几秒音频克隆、30 种语言加 9 种中文方言。Apache-2.0 协议免费商用。
包含 5 篇相关内容
VoxCPM2 是清华 x 面壁智能(OpenBMB)开源的语音合成模型,2B 参数、200 万小时训练数据、48kHz 无损输出。支持文字描述凭空创造音色、几秒音频克隆、30 种语言加 9 种中文方言。Apache-2.0 协议免费商用。
watermarks-remover 开源项目两天狂揽 7700+ Star,系统性清除 AI 内容的隐形水印——Unicode 幽灵字符、统计签名、C2PA 元数据三层覆盖,支持 8 种文件格式,实测效果与隐私保护边界全解析。
基于 React 19 + TypeScript 纯前端构建的开源本地优先工作台 NeumanOS,在一个页面中无缝融合 Markdown 双链笔记、甘特图看板、日历、400+ 公式 Excel 表格与 9 种 AI 模型终端。
开源项目 Ego-Lite 巧妙地将 Chromium 拆分为人类与 Agent 独立的物理隔离空间,既能共享人类账号的真实登录态,又避免 AI 抢夺刷新标签页,支持 Agent 多任务高效并行。
HuggingFace 开源了 speech-to-speech 管道项目,将 VAD 语音检测、STT 转录、LLM 推理与 TTS 语音合成高度统一打通,端到端延迟低至 300ms 且完全本地运行,不泄漏声音隐私。