资讯详情

用几秒参考音频做语音编辑与零样本TTS:VoiceCraft上手

📅 2026/9/19 6:55:55 | 华诺云谱 👁 阅读
用几秒参考音频做语音编辑与零样本TTS:VoiceCraft上手
用几秒参考音频做语音编辑与零样本TTSVoiceCraft上手【免费下载链接】VoiceCraftZero-Shot Speech Editing and Text-to-Speech in the Wild项目地址: https://gitcode.com/GitHub_Trending/vo/VoiceCraftVoiceCraft 是一个零样本语音编辑与文本转语音TTS模型。它不需要针对某个特定说话人重新训练凭几秒钟的参考音频就能克隆或修改一段没听过的声音。训练数据覆盖有声书、网络视频、播客等真实场景所以它的输出更接近日常听感而不是录音室风格。修一句录音里的错别字为什么这么难常规录音流程里录错一个词最简单的办法是改稿后整段重录。当录音很长或者这个声音无法复刻时成本就不划算了。VoiceCraft 的做法是把完整参考音频交给模型再给出原文案和修改后文案两份文本它只重新生成两份文本不一致的那一小段其余音频原样保留。编辑支持删除、插入、替换三种类型。edit_utils.py 逐词比对新旧文案定位出差异区间再把对应位置的音频 token 标成待生成。三种跑起来的方式Colab、Docker、本地安装零经验的情况下最轻量的方式是 Google ColabREADME 里提供了语音编辑和 TTS 两个 notebook逐格运行即可。Docker 方式适合有本地 GPU 的机器。先克隆仓库git clone https://gitcode.com/GitHub_Trending/vo/VoiceCraft然后在仓库目录下构建镜像并启动容器docker build --tag voicecraft . ./start-jupyter.sh # Windows 用 start-jupyter.bat启动后在浏览器打开 inference_tts.ipynb逐格跑通第一次合成。本地安装需要按 environment.yml 装齐依赖Python 3.9、PyTorch 2.0.1对应 CUDA 11.7、ffmpeg、espeak-ng、phonemizer以及做强制对齐的 Montreal Forced Aligner。条目比较多README 里有完整命令。如何跑出第一次零样本语音合成环境就绪后可以直接跑独立脚本python3 tts_demo.py不带任何参数时它会用 demo/ 里的示例音频和脚本内置的英文句子作为提示音与目标文本用那个声音合成新句子。-m可选 giga330M 到 giga830M含 TTS Enhanced 版-oa指定参考音频路径-co指定截取前几秒做提示默认 3.6 秒。想要图形界面运行python gradio_app.py启动 gradio_app.py在 http://127.0.0.1:7860 使用。流程是选模型、加载、转写Whisper 自动出文本、改文案、运行。长文本用 Long TTS 模式逐句合成Smart Transcript 功能则让你只填想生成的那部分文本。Token 填充在音频上填空VoiceCraft 的核心机制叫 token infilling本质是一道填空题。输入先经过两个 tokenizer见 data/tokenizer.py文本被 phonemizer 转成音素序列音频被 Encodec 编解码器压成离散 token——4 个码本、每个码本 2048 个 token16kHz 音频每秒约 50 个 token。然后目标区间的音频 token 全部换成 mask 占位模型以保留的音频 token 完整目标音素序列为上下文自回归地把被遮的位置逐个补出来。在 models/voicecraft.py 中每个时间步按 delayed pattern 依次输出 4 个码本的 token保证同一帧内各码本对齐。音色信息全在参考音频的 token 里模型只需顺着上下文填空所以编辑段和原声在音色、语速上能衔接自然。采样参数与 16 秒上限两个参数对结果影响最大。官方 2025 年 3 月把推理默认采样从 top-p 改为 top-k40编辑和 TTS 效果都有明显提升如果生成结果怪异先检查-k 40。开启 kv cache 可以把生成加速 4~8 倍见 inference_speech_editing_scale.py 里的--kvcache说明。注意长度TTS Enhanced 模型只用了不超过 16 秒的语料训练提示音加生成长度不要超过 16 秒更长的文本交给 Long TTS 模式逐句处理。许可方面代码为 CC BY-NC-SA 4.0模型权重为 Coqui Public Model License 1.0.0均为非商用README 也明确提示未经本人同意不得生成或编辑他人语音。【免费下载链接】VoiceCraftZero-Shot Speech Editing and Text-to-Speech in the Wild项目地址: https://gitcode.com/GitHub_Trending/vo/VoiceCraft创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。