VoxCPM2:开启语音合成新纪元的全能选手

VoxCPM
VoxCPM

在文本转语音(TTS)技术日新月异的今天,一款名为VoxCPM2的全新模型正以其卓越的性能和创新的功能,迅速成为业界关注的焦点。作为VoxCPM系列的最新重大版本,VoxCPM2不仅是一个简单的升级,它代表了一次全方位的跃升,为多语言语音合成、创意声音设计和高保真声音克隆设立了新的标杆。

核心技术:无令牌器的扩散自回归架构

VoxCPM2最核心的突破在于其独特的无令牌器(Tokenizer-Free)、扩散自回归架构。与主流的将语音压缩为离散令牌(Discrete Tokens)的TTS模型不同,VoxCPM2直接在连续语音表征空间上建模。这一设计选择使其能够保留更丰富的声学细节,从而实现更自然、更具表现力的合成效果。

该模型遵循一个高效的四阶段生成流水线:Local Encoder → TSLM → RALM → LocDiT

  • Local Encoder:负责将输入音频编码为紧凑的局部表示,有效缩短了模型需要处理的序列长度。
  • Text-Semantic LM (TSLM):基于强大的MiniCPM-4骨干网络构建,这一层主要负责理解文本内容,并规划出相应的韵律、节奏和重音等高层语义信息,解决“说什么”的问题。
  • Residual Acoustic LM (RALM):作为语义和声学之间的桥梁,这一层将语义信息与声学特征融合,建模精细的声学细节。
  • Local DiT (LocDiT):一个条件流匹配(CFM)扩散Transformer,负责在每一自回归步骤生成高保真的连续语音潜变量,最终由AudioVAE解码为原始波形。

VoxCPM2的革新亮点

相较于前代产品,VoxCPM2在多个关键领域实现了显著提升:

1. 广阔的全球视野:支持30种语言

VoxCPM2在236万小时的多语言数据上完成训练,其中包括180万小时的中英语料和新增的56万小时多语言数据。这使得它能够支持跨越多个语系的30种语言,从英语、中文、日语到阿拉伯语、斯瓦希里语等,覆盖面极广。合成时无需指定语言标签,模型可自动识别输入文本的语言。

2. 录音室级别的音质:48kHz音频输出

VoxCPM2采用了重新设计的AudioVAE V2编解码器。它采用非对称设计:以16kHz的频率编码参考音频,却能直接解码输出48kHz的高保真音频,相当于录音室品质。这一内置的超分辨率能力,使其在无需额外上采样器的情况下,就能提供细节丰富、清晰自然的听觉体验。

3. 从“克隆”到“创造”:Voice Design功能

这是VoxCPM2最具颠覆性的功能之一。Voice Design(声音设计) 允许用户仅通过自然语言描述来创造一个全新的声音,而无需任何参考音频。例如,你可以输入“一位年轻女性,温柔甜美的声音”,模型便能直接生成符合描述的语音。这极大地降低了声音创作的门槛,为内容创作者、游戏开发者等提供了无限可能。

4. 更细腻的控制:Style Control

在进行声音克隆时,VoxCPM2赋予了用户前所未有的控制力。Style Control(风格控制) 功能允许你通过简单的文本标签,自由地控制克隆声音的情感、节奏和说话风格,例如“稍快语速,愉悦的语调”。这意味着你可以在保留目标说话人音色的同时,指导其表达方式,使合成语音更贴合具体场景。

5. 更智能的融合架构

为实现上述强大的功能,VoxCPM2在架构内部也进行了重要革新:

  • Concat-Projection融合:在Residual Acoustic LM阶段,不再像1.x版本那样直接相加语义和声学特征,而是采用拼接后通过可学习线性投影的方式。这使得模型能更灵活地融合两种信息,避免了信息损失。
  • 多Token条件输入:在向Local DiT传递条件信息时,不再使用单一的融合条件Token,而是使用包含更丰富信息的多Token前缀,为最终的声学生成阶段保留了更多细节。

性能与部署

VoxCPM2在多项公开的零样本(Zero-shot)和可控TTS基准测试中,均取得了业界领先或相当的成绩。例如,在Seed-TTS-eval测试中,其英文单词错误率(WER)低至1.84%,说话人相似度(SIM)达到75.3%

在部署方面,VoxCPM2也非常友好。在NVIDIA RTX 4090显卡上,其实时因子(RTF)约为0.30,已能满足实时应用需求;若借助Nano-VLLM加速,RTF可进一步降低至0.13。模型推理时显存占用约为8GB ,并且支持流式合成,可用于需要低延迟响应的场景。

总结

VoxCPM2凭借其无令牌器的创新架构、强大的多语言能力、录音室级别的音质、以及开创性的“声音设计”和“风格控制”功能,成功地将TTS技术从“能说话”推向了“会说话”和“创造性地说话”的新阶段。更值得一提的是,该模型在Apache-2.0许可下完全开源,免费可用于商业用途,这无疑将极大地推动高质量语音合成技术的普及与创新。


相关链接