RVC 实战手册:10 分钟素材训练一个 AI 音色模型并跑通实时变声
RVC 实战手册10 分钟素材训练一个 AI 音色模型并跑通实时变声【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI假设你有这样一个需求手头有一段十几分钟的目标音色录音某位歌手或主播你希望把它变成一个可以复用的变声模型——以后任意一段自己的录音丢进去都能用他的声音说同样的话。RVCRetrieval-based-Voice-Conversion-WebUI检索式语音转换 WebUI就是为此设计的开源框架基于检索机制替换源特征用 10 分钟左右的低底噪语音即可训练出可用模型并且提供网页训练界面和独立的实时变声界面。检查环境与安装依赖整个安装可以按检查 → 安装 → 启动三步走全部在仓库根目录完成。第一步环境检查。本分支面向 Python 3.12 x64推荐 Ubuntu 24.04 x86_64 或 Windows。需要确认两件事Python 版本是否为 3.12python --version是否有 NVIDIA 显卡可选CPU 也能跑但训练会很慢。可用nvidia-smi查看代码内置的选卡规则是显存 ≥ 4GiB 且计算能力 ≥ 5.3 才会启用 GPU老 Pascal 和 GTX 16 系会退回 fp32逻辑在 configs/config.py第二步克隆并安装依赖。按硬件选对应的依赖文件git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUIUbuntu 先装系统依赖sudo apt update sudo apt install -y python3.12 python3.12-venv python3.12-dev ffmpeg unzip libsndfile1 libportaudio2 python3.12 -m venv .venv source .venv/bin/activate然后按硬件装 Python 依赖。NVIDIA 显卡需要两阶段安装先装匹配的 Torch再装项目依赖RTX 50 系用 cu128其余用 cu118# RTX 50 系以前CUDA 11.8 python -m pip install torch2.7.1cu118 torchaudio2.7.1cu118 \ --index-url https://download.pytorch.org/whl/cu118 --extra-index-url https://pypi.org/simple python -m pip install -r requirments_cu118_py312.txt # CPU / AMD / Intel 显卡只装这一个文件即可 # python -m pip install -r requirments_cpu_py312.txt装完用一行命令验证python -c import torch; print(torch.cuda.is_available())输出True即 CUDA 可用。Windows 没有 FFmpeg 的话把ffmpeg.exe和ffprobe.exe放到项目根目录即可仓库文档给出了下载地址。第三步下载预训练权重。推理和训练都依赖assets/目录下的权重Hubert 特征模型、RMVPE 音高模型、底模等按仓库 README 的hf download命令从模型仓库拉取保持目录结构assets/hubert_base/、assets/rmvpe/rmvpe.pt、assets/pretrained/v1 底模、assets/pretrained_v2/v2 底模、assets/uvr5_weights/。启动 WebUI 并认识界面启动命令很简单python webui.py默认监听 7865 端口并自动打开浏览器服务器环境加--noautoopen。端口冲突时代码会自动尝试下一个端口。Windows 下也可以直接双击go-webui.bat。打开后是一个标签页式界面与本文动线相关的有四个模型推理含单次推理、批量推理、伴奏人声分离去混响去回声、训练、ckpt处理模型融合。界面默认中文支持英、日、韩、法、土、葡等语言语言包在 i18n/locale/。从零训练第一个音色模型这一节把训练 → 推理当成一条任务线走完。训练相关源码在 train/推理核心在 infer/这里只讲界面操作和关键参数。准备素材。收集 10 分钟以上建议 10~50 分钟低底噪的目标音色录音切成若干段放进一个文件夹。音频格式只要是 FFmpeg 能读的即可wav、mp3 都行。注意两点文件夹里的音频只读取一层不递归子目录素材底噪越低模型越干净。Step1 处理数据。进入训练标签页实验名自定如my-voice实验数据都会落在logs/my-voice/目标采样率48k质量最佳32k 更省资源是否带音高指导唱歌类必须开纯语音类可关版本v1 或 v2v2 底模效果更新训练数据量要求更低填入训练文件夹路径和说话人 id点处理数据这一步会做静音切分、降噪和片段化输出 4 秒左右、带 0.3 秒重叠的 wav 片段。Step2 特征提取。选择音高提取算法当前版本界面提供pm和rmvpe两个选项默认rmvpe后点特征提取。RMVPE 是 InterSpeech 2023 的算法速度快、资源占用小能较好避免哑音问题有 GPU 时优先选它多卡可在rmvpe 卡号配置里按0-0-1这类格式分配进程。Step3 训练模型和索引。填写训练参数total_epoch总轮数数据少10 分钟级取 100~200 之间数据更多或质量更高可少一些batch_size显存允许就调大显存不足降到 1~2预训练底模 G/D 路径默认已指向assets/pretrained/不必动点一键训练会依次完成模型训练和特征索引训练也可以分开点训练模型、训练特征索引训练结束后模型.pth在assets/weights/索引.index在assets/indices/。用它转换音频。切到模型推理 → 单次推理刷新音色列表选择刚训练的模型索引会自动匹配可手动改上传或填入待转换音频设三个参数变调整数半音数升八度 12、降八度 -12。同性别互转一般设 0检索特征占比检索特征的使用比例影响目标音色的相似度与稳定性默认值先不动后处理重采样至最终采样率0 表示不重采样否则填 32000/40000/48000点转换即可试听输出。批量任务用批量推理可整文件夹转换并指定输出目录。效果诊断遇到什么现象就查什么训练和推理阶段的问题基本都可以按现象 → 原因 → 调法处理不必逐条排查。训练完但找不到模型 / 推理列表里没有音色。先确认assets/weights/里有生成的.pth且体积正常几十 MB 量级再看assets/indices/里是否有对应.index——索引缺失说明训练特征索引没跑完。推理页点刷新音色列表。音色像自己不太像目标音色。这是检索占比的问题调高检索特征占比能加强目标音色但过高可能出现不自然、发音变形的毛刺反过来调低则更稳更像自己。建议在 0.3~1.0 之间小步试每次改一档对比试听。同时检查训练素材是否混进了别人的声音或大量噪声这类数据需要重新切分。CUDA 内存不足 / 报错中断。优先减小batch_size降到 1 或 2其次把目标采样率从 48k 降到 32k。代码会根据显存自动收紧一批内部参数但batch_size和采样率是你手里最直接的旋钮。推理有哑音或断音。确认推理时选用的音高提取算法与训练一致都建议 RMVPERMVPE 权重需位于assets/rmvpe/rmvpe.pt缺失会直接影响音高估计质量。想从中间状态继续练。训练会按save_every_epoch在logs/实验名/下存G_{}.pth/D_{}.pth可以指定某个中间 ckpt 作为起点继续训练或把中间产物直接放到推理页试效果。两个值得深入的场景AI 歌手。素材换成目标歌手的清唱最好先经过 UVR5 分离出纯人声伴奏人声分离标签页就是干这个的训练时音高指导必须开启版本建议 v2。推理时变调按你和目标歌手的音域差调整如你比他低八度就设 -12 附近微调检索占比适当调高。多段不同歌曲的素材混合训练能覆盖更宽的音域。实时变声。这是一个独立入口python realtime_gui.pyWindows 下为go-realtime_gui.bat不依赖 WebUI。项目实现的端到端延迟约 170ms若输入输出设备支持 ASIO 可进一步压到约 90ms但非常依赖硬件驱动。使用时的经验输入设备优先选低延迟的ASIO 或 WASAPI 独占系统音频缓冲区调小效果与延迟冲突时宁可牺牲一点音质档位换延迟。适合直播、游戏语音这类说话即变声的场景。资源导航多语言文档与常见问题docs/中文 FAQ 在docs/cn/faq.md训练技巧在docs/en/training_tips_en.md等推理核心infer/其中音高模型在 infer/rmvpe.py训练管线train/数据切分在 train/dataset/模型结构配置各采样率 jsonconfigs/实时变声入口realtime_gui.py下一步建议先用手头任意一段 10 分钟以上的干净录音按上文流程完整跑一次训练 → 推理拿到第一个可听的结果后再针对音色相似度调检索特征占比最后再考虑实时变声部署。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考