怎么用一段短样本克隆声音(并且克隆好)
给它 10~20 秒干净的人声,它就能用这个声音念出新的文字。克隆质量几乎完全由这一段样本决定——样本对了,剩下的水到渠成。
好样本长什么样
工具接受 WAV、MP3 或 M4A——单声道、至少 24kHz、10~20 秒清晰人声(硬上限:60 秒、10 MB)。在这个范围里,尽量做到:
- 一个人,正常说话。平实的叙述,不要喊也不要耳语。克隆会照搬它听到的状态。
- 背景全静。没有音乐、没有电视、没有街道噪音。人声背后是什么,都会被一起「烤」进去。
- 几句完整的话,而不是孤立的词。模型需要自然的节奏和语调才能模仿。
哪些错误会毁掉克隆
大多数让人失望的结果,问题出在样本,不在工具:
- 背景噪音或回声。混响大的房间或风扇嗡嗡声,会让克隆发闷。找个软一点、小一点的地方录(塞满衣服的衣柜是经典土办法)。
- 爆音/削波。原录音录得太大、峰值已经失真,克隆会继承这份失真。把麦克风拉远,或调低输入电平。
- 两个人声。结尾被别人插话的片段会让模型困惑。剪到只剩目标说话人。
- 太短。三秒钟没有足够的节奏可供模仿,老老实实给满 10~20 秒。
如果克隆听着不对,别去调参数——重录一段更干净的样本。十次有九次是这能解决的。
生成后,验一下
克隆好之后,输入一句原样本里没有的话再听。新词才是真正的考验——给过的短语任何工具都能回放。结果以 WAV 下载。
合规使用
只克隆你有权使用的声音——你自己的,或明确同意的人。未经同意克隆他人声音,是会惹上真麻烦的事,也不是这个工具的用途。
隐私方面:处理在你浏览器里进行,样本留在你设备上,不发往服务器。
手头有干净的片段了?放进声音克隆工具,让它念点新东西。