VOICE LAB / OPENVOICE V2 / 2026-10-03
新底座研究小样 · 非 Adele
同一段本人清唱,使用预训练 OpenVoice V2 试转为参考音色。先听模型重建,再比较不同插值参数。
目标参考是 Linda Johnson 的开放讲话录音,不是 Adele。
OpenVoice 以讲话转换为主;这里是未经音质验收的清唱研究试转,没有新增训练,也没有将原声与转换结果两条波形叠加。滑杆中间值不是人耳感知的真人身份比例。
OpenVoice 以讲话转换为主;这里是未经音质验收的清唱研究试转,没有新增训练,也没有将原声与转换结果两条波形叠加。滑杆中间值不是人耳感知的真人身份比例。
一次听一条,比较实际输出
原生播放器互斥播放,没有自动播放。用耳机保持同一音量,留意噪声、歌词清晰度、音高变化和双声部感;这些小样没有证明音质胜者或 Adele 混合能力。
本人清唱原声
所有转换都使用这一段;它不是新录制的说话样例。
下载原声 WAV模型重建本人
检查模型本身是否引入缺陷。这与产品 0% 的原声旁路不同。
下载重建 WAVα = 0.25
一次模型生成,不是将两条声音按 75:25 混音。
下载 WAVα = 0.50
这个参数不能解释成“听起来一半本人、一半目标”。
下载 WAVα = 0.75
参考音色变化与自然度要分别试听判断。
下载 WAVα = 1.00 · Linda Johnson
使用完整目标参考向量;以本人输入作为内容与旋律来源,实际保留程度待试听。
下载 WAV想用自己的新录音?
这张网页只播放预先生成的 WAV。实际录音、上传和转换在本地工作台进行,需要启动推理后端。
- 1 · 安装与启动按照 GitHub 工作台说明准备环境与模型,运行启动脚本并保持终端打开。
- 2 · 录音或载入示例打开本机
http://127.0.0.1:8872,录音或上传;也可点击“载入现有 8 秒清唱”。 - 3 · 生成再试听选择真实目标参考,先试完整目标端,再检查本人重建和实验插值;保存 WAV 与运行收据。
本机 CPU 实测:预热后处理 8 秒输入约需 6–8 秒;它是停止录音后的转换,尚未实现连续流式实时变声。本页面播放音频不启动模型推理。
方法与结果边界
LERP(Linear Interpolation,线性插值)在模型内部将本人参考与目标参考的身份向量按权重组合,生成单条输出。参数变化不保证听感单调,也不保证单一自然人声。
本次用了开放女声参考与本人清唱,只进行预训练模型推理;没有训练 Adele 音色,没有完成说话质量基准,清唱质量也尚未验收。后续歌声专用模型仍需使用同一输入做实测比较。
参考来源:LJ Speech 官方资料,Linda Johnson,官方声明为 Public Domain(公共领域)。模型:OpenVoice 官方仓库。