恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
RVC 变声器完整指南:4G 显存克隆专属声音模型
首页
资讯中心
/
RVC 变声器完整指南:4G 显存克隆专属声音模型
RVC 变声器完整指南:4G 显存克隆专属声音模型
发布时间:2026/9/20 6:55:07
RVC 变声器完整指南4G 显存克隆专属声音模型【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRetrieval-based Voice Conversion WebUI下称 RVC是基于 VITS 架构的开源变声器与语音克隆工具喂给它一段目标人声录音它训练出一个音色模型之后任何音频输入都会以那个音色重新输出。本文先给出硬件门槛和准备清单再依次走查数据、环境、训练参数以及训完之后最容易被漏掉的两步。 门槛清单跑 RVC 语音克隆模型要备齐什么先回答最关心的问题我的显卡够不够用结论4G 显存是训练和推理的及格线。程序启动时会自动读显存大小并调整内部参数4G 以下会改用更保守的分块配置如果 batch size每轮训练喂给显卡的音频量缩到 1 还报 OOMOOM 即 out of memory显存装不下了那就是显卡确实不够只能换卡或租云 GPU。官方 FAQ 对 3G、2G 老卡的建议是直接放弃。还有个隐藏成本内存。音频切分和音高提取靠 CPU 多进程干活训练时如果出现文件/内存报错把页面上的CPU 进程数调低或手动把训练音频切短一些。动手前确认这四项项目要求显卡显存 ≥4G录音10~50 分钟目标人声录音干净时 5~10 分钟可用底模文件官方预训练底模按 README 放到 assets/ 下音频工具ffmpeg切分和重采样都靠它底模是官方预训练好的通用语音模型你的训练是在它基础上微调不是从零开始。缺了 assets/ 下的底模训练和推理都起不来。10 分钟目标人声录音怎么备录音决定效果上限而且是唯一没法事后返工的一步。要点做法环境尽量安静压低背景噪音。底噪会直接进模型训练轮次再高也压不下去表现力语速、语调、情绪带点变化单一腔调覆盖不了全部发音状态片段长度几十秒到一两分钟一段过长对切分和内存都是负担格式统一转 WAV采样率不用纠结预处理阶段会自动重采样录音干净、底噪低、音色有辨识度的话5~10 分钟也能训出可用模型。RVC 变声器环境安装与网页训练页启动所有命令都在项目根目录执行git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI python -m venv .venv激活虚拟环境后按显卡装依赖显卡依赖清单NVIDIA非 RTX 50 系requirments_cu118_py312.txtNVIDIARTX 50 系requirments_cu128_py312.txt两阶段安装见 READMEAMD WindowsDirectML/ CPUrequirments_cpu_py312.txtpip install -r requirments_cu118_py312.txt还有两项准备安装 ffmpegUbuntusudo apt install ffmpegmacOSbrew install ffmpeg下载底模文件底模、HuBERT 特征模型、rmvpe 音高模型等按 README 列出的目录结构放进 assets/ 下。启动python webui.py浏览器会自动打开 7865 端口的训练网页。Windows 用户也可以直接双击 go-webui.bat 走整合包路线。⚙️ 4G 显存显卡的训练参数怎么定训练页里值得动的数字只有三个其余保持默认参数怎么设原因总轮数epoch有底噪20~30 轮干净且时长足可到 200 轮底噪大的数据训太多轮模型会把噪音也学进去轮次再高也拉不动音质保存间隔每 10 轮存一个点逐个试听挑最早达标的避免过拟合批次大小batch size用页面默认OOM 再往下调默认按显存自动估算约为显存 GB 数的一半是稳定起步值另两个影响明显的选项顺手设好采样率选 48k对应 v2 底模是官方配置里质量上限最高的一档见 configs/v2/48k.json音高提取算法选 rmvpe效果最好且只占少量显存harvest 低音更好但极慢pm 适合歌声输入时提速确认训练集文件夹路径、填一个实验名——模型、索引、日志都挂在这个名字下面——点一键训练。流程会依次执行切分、音高提取、特征提取、训练全程日志写在 logs/实验名/ 下训练脚本在 train/ 目录。 训练结束后别漏掉 faiss 索引faiss 索引是把训练集音色特征做成的一张检索表推理时从中查最接近的音色样本混进来让输出音色不偏离训练集。跳过它音质可能不错但相似度会打折。点训练索引产物是 logs/实验名/ 下 added_ 开头的 .index 文件。一键训练结束却看不到索引多半是训练集太大卡住了索引添加步骤重按一次即可FAQ Q2。推理时 index rate 与 protect 怎么调切到模型推理页点刷新音色选中你的模型和索引上传一段音频转换。重点旋钮是 index rate范围 0 到 1默认 0.75接近 1音色完全锚定训练集不会漏出输入源或底模的音色但音质上限被训练集锁死拉到 0不做检索保护音质可能更好音色泄露问题会回来训练集本身优质且时长足这个值其实不重要模型自己不太引用外部音色两个小项变调按整数半音算半音是音高的最小级差12 升八度、-12 降八度protect滑条默认 0.33防清辅音和呼吸声撕裂输出有电音就往高调 批量变声与实时推理单条跑通后有两个进阶方向批量不用开网页走命令行推理目录里的 wav 可以逐个转换参数示例见 docs/cn/faq.md 的 FAQ Q7实时双击 go-realtime_gui.bat 启动实时界面。官方端到端延迟 170ms换 ASIO 输入输出可压到 90ms但后者非常依赖声卡驱动支持普通 USB 声卡别期待这个数字最后在推理页挑一个保存点模型把录音里没用进训练的一段喂进去输出的音色与原主一致的话整条流程就通了。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考