VOICE LAB / OPENVOICE V2 / 2026-10-03

新底座研究小样 · 非 Adele

同一段本人清唱,使用预训练 OpenVoice V2 试转为参考音色。先听模型重建,再比较不同插值参数。

目标参考是 Linda Johnson 的开放讲话录音,不是 Adele。
OpenVoice 以讲话转换为主;这里是未经音质验收的清唱研究试转,没有新增训练,也没有将原声与转换结果两条波形叠加。滑杆中间值不是人耳感知的真人身份比例。

一次听一条,比较实际输出

原生播放器互斥播放,没有自动播放。用耳机保持同一音量,留意噪声、歌词清晰度、音高变化和双声部感;这些小样没有证明音质胜者或 Adele 混合能力。

固定输入 · 8 秒

本人清唱原声

所有转换都使用这一段;它不是新录制的说话样例。

下载原声 WAV
本人参考 · 强制模型推理

模型重建本人

检查模型本身是否引入缺陷。这与产品 0% 的原声旁路不同。

下载重建 WAV
LERP · 实验向量权重

α = 0.25

一次模型生成,不是将两条声音按 75:25 混音。

下载 WAV
LERP · 实验向量权重

α = 0.50

这个参数不能解释成“听起来一半本人、一半目标”。

下载 WAV
LERP · 实验向量权重

α = 0.75

参考音色变化与自然度要分别试听判断。

下载 WAV
完整参考转换 · 非 Adele

α = 1.00 · Linda Johnson

使用完整目标参考向量;以本人输入作为内容与旋律来源,实际保留程度待试听。

下载 WAV

想用自己的新录音?

这张网页只播放预先生成的 WAV。实际录音、上传和转换在本地工作台进行,需要启动推理后端。

  1. 1 · 安装与启动按照 GitHub 工作台说明准备环境与模型,运行启动脚本并保持终端打开。
  2. 2 · 录音或载入示例打开本机 http://127.0.0.1:8872,录音或上传;也可点击“载入现有 8 秒清唱”。
  3. 3 · 生成再试听选择真实目标参考,先试完整目标端,再检查本人重建和实验插值;保存 WAV 与运行收据。
本机操作与安装说明查看与下载工作台源码

本机 CPU 实测:预热后处理 8 秒输入约需 6–8 秒;它是停止录音后的转换,尚未实现连续流式实时变声。本页面播放音频不启动模型推理。

方法与结果边界

LERP(Linear Interpolation,线性插值)在模型内部将本人参考与目标参考的身份向量按权重组合,生成单条输出。参数变化不保证听感单调,也不保证单一自然人声。

本次用了开放女声参考与本人清唱,只进行预训练模型推理;没有训练 Adele 音色,没有完成说话质量基准,清唱质量也尚未验收。后续歌声专用模型仍需使用同一输入做实测比较。

参考来源:LJ Speech 官方资料,Linda Johnson,官方声明为 Public Domain(公共领域)。模型:OpenVoice 官方仓库。