【AI翻唱】AI翻唱哪家强?So-VITS 与 Diff-SVC 的效果直观对比
Parts
Description
还有个DDSP-SVC因为效果确实不行所以没加入对比了,但是DDSP对低配真的友好,我很喜欢。 音声来源:香风智乃/水濑祈 输入源:いつも何度でも - 伊藤サチコ So-VITS 4.0 本地训练/推理教程:BV1H24y187Ko
还有个DDSP-SVC因为效果确实不行所以没加入对比了,但是DDSP对低配真的友好,我很喜欢。 音声来源:香风智乃/水濑祈 输入源:いつも何度でも - 伊藤サチコ So-VITS 4.0 本地训练/推理教程:BV1H24y187Ko
Comments
个人体验,sovits加聚类某些场合下表现会优于diff svc,gan网络训练调参是难题,diffusion虽然更容易收敛但是大部分人应该都没有能撑起那个质量的数据集。sovits会带点电但是娱乐一下做做二创足够了,加上伴奏一混大部分人也听不出明显差别。4.0v2的visinger结构有部分参考了vits,改善呼吸声带电,但是有些发音会炸,比较玄学。
♥ 149 ↩ 12
diff svc太吃数据集了,感觉要数据质量很高才能用,我练的那几炉没法用。像我们普通人能弄得的数据集声音忽大忽小,有杂音有BGM的,还是sovits更robust一点。[笑哭]另外不知道为什么我练的sovits3.0效果比4.0好不少,可能是因为我大部分数据时长都在1s左右,这么短数据的4.0训练的时候会直接忽略[笑哭]还有请问能不能出个diff singer的对比?我还没来得及玩那个
♥ 101 ↩ 9
我是发现,最复杂的是对输入的音频预处理,要去伴奏,消和声,麻烦的很…
♥ 34 ↩ 7
哼唱的话,应该是人声分离的锅,uvr什么时候AI质变一下,期待[doge]
♥ 32 ↩ 39
So-VITS是不是永远不会有5.0了
♥ 21 ↩ 17
Diff-SVC要饱满些,但是都还要后期去齿音[doge]
♥ 15 ↩ 1
我有个想法,可以用洛天依唱歌,然后So-VITS 转换音色
♥ 9 ↩ 10
我这木耳完全听不出区别orz
♥ 6 ↩ 2
在这个视频里的两个我更喜欢sovits的,diffsvc的有点不稳
♥ 5
如果数量多(上千条),那么diff会更好。
♥ 4 ↩ 1
diff svc只能用来做翻唱吗?可以用来做正常说话吗?
♥ 3 ↩ 1
开头我还以为我手机铃声响了😡
♥ 3
现在ddsp6的效果咋样呢
♥ 2 ↩ 1
只能N卡用?
♥ 2 ↩ 1
so-vits yyds
♥ 2
不说准确度,感觉sovits声音更讨喜
♥ 2
为什么在线版的模型,转换的声音都非常差,我是专门调的单声道22050采样wav格式的文件的
♥ 2
我觉得还得ace stdio
♥ 2
蛙趣
♥ 2
replay;seedvc;neucosvc我目前了解了这三种翻唱方法,不知道哪个更有优势,有没有知道的大佬说一下区别?避免走弯路
♥ 1