恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

GPT-SoVITS语音克隆完整教程:1分钟音频跑通微调级文本转语音

  • 首页
  • 资讯中心
  • /
  • GPT-SoVITS语音克隆完整教程:1分钟音频跑通微调级文本转语音

相关资讯

国产中文编程语言 zlang 发布:中文写代码,到底是噱头还是真需求 2026/9/2 12:58:10
从单片机到硬件设计:原理图解读与电路模块实战指南 2026/9/2 12:58:10
WSL多版本管理:让3个Ubuntu版本与WSL 1/2在同一台机器上共存 2026/9/2 12:58:10

最新资讯

CTF密码破解实战:从Base64到维吉尼亚的幽灵潜艇谜题解析
Python分布式系统实战:CAP、事务、幂等与分布式锁工程落地
Hy4 preview本地运行:从AI工作台到开发流程重构
深入理解C++ 模板<二> 类的模板
GitHub MCP Server 多语言配置全指南:3 种方式让工具描述变中文
Claude Code周限额提升25%:安装配置与配额管理实战指南

今日推荐

DeepSeek字幕翻译实战:从API调用到批量SRT转中文的完整方案
用Python搭建搞笑语音助手:从语音识别到语音合成全教程
ROS2阿克曼底盘仿真:从运动学原理到Nav2导航集成实践

本周热门

备战数据库管理工程师校招:索引、事务、备份恢复核心考点解析
数字电路时序基石:深入理解建立时间与保持时间
蓝桥杯国赛超声波测距机:从单片机原理到嵌入式系统实战

本月精选

自研推理加速器Redwood:两周内实现PyTorch模型高效部署的实战教程
V4L2摄像头采集实战:从camera_client.rar到出图全流程解析
从“谁发明了钢琴键”到知识问答智能体:RAG与记忆工程实践

GPT-SoVITS语音克隆完整教程:1分钟音频跑通微调级文本转语音

发布时间:2026/9/2 12:58:10
GPT-SoVITS语音克隆完整教程:1分钟音频跑通微调级文本转语音 GPT-SoVITS语音克隆完整教程1分钟音频跑通微调级文本转语音【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITSGPT-SoVITS是一个开源的少样本语音克隆与文本转语音TTSWebUI5秒参考音频即可零样本合成1分钟训练数据即可微调出专属音色支持中、英、日、韩、粤语混合输入。按本文操作你能在自己的机器上完成安装启动、零样本试听、六步微调训练并把成果封装成API服务。 一键安装并启动WebUI按硬件选择安装参数先确认你的环境在官方测试范围内避免装到一半报错PythonPyTorch目标设备3.102.5.1CUDA 12.43.112.7.0CUDA 12.83.92.8.0devCUDA 12.83.92.5.1Apple silicon3.92.2.2纯CPU克隆仓库后执行安装脚本它会自动装 ffmpeg、PyTorch、依赖包并下载预训练权重到 GPT_SoVITS/pretrained_models/、G2PW中文音素模型到GPT_SoVITS/text/G2PWModelgit clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS cd GPT-SoVITS conda create -n GPTSoVits python3.10 conda activate GPTSoVits bash install.sh --device CU128 --source HF --download-uvr5--device可选CU126、CU128、ROCM、MPS、CPU按你显卡的CUDA版本选--source可选HF、HF-Mirror、ModelScope三个模型源--download-uvr5会顺带下载人声分离权重到tools/uvr5/uvr5_weights。脚本末尾打印 Installation Completed 即成功此时目录里已有sv声纹模型、v2Pro权重等子目录。手动补齐缺失的权重如果不想跑脚本、手动装依赖pip install -r extra-req.txt --no-deps后再装requirements.txt需要确认三类文件到位预训练权重放GPT_SoVITS/pretrained_modelsG2PWModel 解压后放GPT_SoVITS/textUVR5权重放tools/uvr5/uvr5_weights。语音识别模型首次使用时会自动下载离线环境可提前把 FunASR 和 faster-whisper 模型放到tools/asr/models。⚡ 最快出效果的路径跳过训练直接零样本推理装好环境后先别急着训练用5秒音频验证全流程是否跑通。在项目根目录启动主WebUIpython webui.py浏览器打开http://localhost:9874进入推理界面也可以单独启动推理页python GPT_SoVITS/inference_webui.py默认端口9872。在推理标签页里上传一段5到10秒的清晰人声作为参考音频填上这段音频对应的文字选择参考语言和目标语言输入要合成的文本点击合成。完成后你能直接听到目标文本用参考音色朗读出来——这就是零样本TTS不训练、即时出声。如果不想微调还可以在下拉里选不训练直接推v2ProPlus底模这类选项用预训练底模配合你的参考音频出效果适合快速对比不同底模的差异。 能力解析两段式架构与模型版本选择为什么它合成又快又像GPT-SoVITS采用两段式结构前半段GPT模型把文本和参考音频编码成语义token序列负责内容、韵律和情绪后半段SoVITS声码器基于BigVGAN把token还原成波形负责音色还原。参考音频的声纹特征由ERes2NetV2声纹模型提取后注入两段模型所以5秒样本就能锁定音色。推理速度参考官方数据硬件实时因子RTF实测说明RTX 4060 Ti0.0281400字约4分钟文本RTX 40900.014同样1400字仅耗时3.36秒Apple M4CPU模式0.526可跑但偏慢RTF小于1意味着比实时快0.014表示合成速度是实时的约70倍。新手建议有N卡直接用GPUM系列Mac选MPS/CPU模式即可满足日常试听。版本怎么选六个版本的权重路径和定位都写在config.py的pretrained_sovits_name字典里官方README也给出了升级说明版本SoVITS权重位置官方定位新手判断v1s2G488k.pth2k小时预训练的老版本仅做历史对照v2gsv-v2final-pretrained/s2G2333k.pth5k小时预训练新增粤韩支持音频质量一般时可用v2Prov2Pro/s2Gv2Pro.pth效果超v4硬件成本与速度同v2默认首选v2ProPlusv2Pro/s2Gv2ProPlus.pthv2Pro加强版追求上限再试v3s2Gv3.pth相似度更高抗重复漏读训练集需较干净v4gsv-v4-pretrained/s2Gv4.pth修复v3金属音原生48k输出高质量数据再上一个关键取舍v1/v2/v2Pro对平均质量偏一般的训练集也能出 decent 效果而v3/v4对数据质量要求更高且合成音色更贴近参考音频而非整体训练集。新手建议无脑从v2Pro开始数据干净且追求音色贴近参考音频时再换v4。️ 完整操作流程六步微调出专属音色第一步填入原始音频路径在WebUI的训练数据准备页填入录音目录。录音要求不高但要清晰同一说话人1到5分钟、干声、无重混响。第二步自动切片用内置切片器把长音频切成训练片段它会按能量曲线切分并过滤静音。核心参数threshold音量阈值、min_length片段最短时长、min_interval相邻片段最小间隔、hop_size能量曲线步进。命令行版在 tools/slicer2.py参数含义与WebUI一致。完成后目录里会多出一批几秒到十几秒的wav文件。第三步降噪可选原始音频有底噪时点一下降噪没有则跳过省时间。第四步语音识别自动标注内置三个识别后端Fun-ASR-Nano中英日韩自动检测、SenseVoice快速转写、经典FunASR中文粤语。纯命令行批量标注这样跑python tools/asr/funasr_asr.py -i 音频目录 -o 输出list -l zh执行完会在目录里生成一个.list标注文件这就是后续训练直接消费的格式/绝对路径/切片001.wav|说话人名|zh|这段音频里说的一句话语言字段取zh、en、ja、ko、yue之一一行一条样本。第五步人工校对打开校对界面逐条检查识别文本改错字、补标点。这一步直接决定发音准确率是六个步骤里最值得花时间的。第六步先训GPT再训SoVITS切到模型训练标签页按顺序训练两个模型。GPT端S1默认配置见GPT_SoVITS/configs/s1.yaml300轮、batch 8、梯度累积4SoVITS端S2以v2Pro为例见GPT_SoVITS/configs/s2v2Pro.json100轮、学习率0.0001、fp16开启。训练完成后权重分别落到GPT_weights_v2Pro/和SoVITS_weights_v2Pro/回推理页下拉里选中这两个新权重就能用你的专属模型合成——和零样本模式对比一下相似度会明显更稳定。 常见问题快速修复显存不足或老显卡报错用环境变量is_halftrue启用fp16减半显存Docker里同样生效注意config.py的get_device_dtype_sm会自动判断显存小于4GB、或SM版本为6.1/16系卡时强制回退fp32甚至CPU这不是你装错了是保护机制。CUDA版本不匹配先用nvidia-smi看驱动支持的CUDA上限再决定--device CU126还是CU128。驱动较新时两个都能装装错的症状是 torch 导入时找不到libcudart。macOS上训练质量差官方明确提示Mac用GPU训练的模型质量明显偏低所以--device请选MPS实际走CPU路径而不是GPU。Mac用户把训练交给云端或N卡机器本地只做推理和切片更合理。端口冲突项目固定占用五个端口主WebUI 9874、UVR5 9873、推理页 9872、校对页 9871、API 9880定义在config.py。被占用时按报错提示的端口改对应变量重启即可。 进阶玩法把成果变成API服务启动WebAPI微调好的模型想给其他程序调用直接起 api_v2.py 里的WebAPI服务python api_v2.py -a 127.0.0.1 -p 9880 -c GPT_SoVITS/configs/tts_infer.yaml配置文件 tts_infer.yaml 里按版本列出了各自的权重路径和设备改version段即可切换底模。POST/tts接口传text、text_lang、ref_audio_path、prompt_text、prompt_lang五个必填项再调speed_factor控语速、repetition_penalty默认1.35抑制重复成功直接返回wav字节流。命令行批量合成脚本化处理用GPT_SoVITS/inference_cli.py参考文本和目标文本都写成txt文件后一条命令出结果python GPT_SoVITS/inference_cli.py \ --gpt_model GPT_weights_v2Pro/你的权重.ckpt \ --sovits_model SoVITS_weights_v2Pro/你的权重.pth \ --ref_audio ref.wav --ref_text ref.txt \ --ref_language 中文 --target_text text.txt \ --target_language 中文 --output_path out/跑完out/output.wav就是成品适合放进定时任务批量出片。Docker生产部署生产环境推荐容器化docker-compose.yaml提供完整版和Lite版不含ASR与UVR5权重两套服务Windows下记得把shm_size调到16gdocker compose run --service-ports GPT-SoVITS-CU128进入容器用docker exec -it GPT-SoVITS-CU128 bash之后操作和本地完全一致。 开始前记住四件事先用5秒零样本验证环境和音色上限再决定是否投入微调顺序反了会白训。数据质量高于数量1分钟干净干声胜过10分钟带噪声录音校对环节别省。版本默认v2Pro只有训练集足够干净且需要音色贴近参考音频时才上v4。自用走WebUI生产走api_v2的/tts接口两者共用同一套权重互不冲突。更多细节可查 中文文档训练出问题时优先核对GPT_SoVITS/configs/下对应版本的yaml是否与你的数据长度匹配S1默认支持最长54秒样本。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号