Description
在本实验中,数据处理部分采用了48000 Hz的采样率,梅尔频谱参数设置为128个梅尔频谱通道,最小频率为0 Hz,最大频率未指定。窗口长度为2048,跳跃长度为480,最大波形值为32768.0。
模型架构方面,过滤通道数为768,隐藏通道数和内层通道数均为192,卷积核大小为3,层数为6,注意力头数为2,丢弃率为0。残差块为类型1,膨胀大小为[[1, 3, 5], [1, 3, 5], [1, 3, 5]],卷积核大小为[3, 7, 11]。上采样初始通道数为512,上采样卷积核大小为[24, 20, 4, 4],上采样率为[12, 10, 2, 2],未使用谱归一化。
训练设置中,批量大小为8,优化器参数为β1=0.8, β2=0.99, ε=1e-09,初始学习率为0.0001,学习率衰减为0.999875,训练轮数为20000,日志间隔为每200步,使用FP16,并使用了预训练的生成器和判别器模型。
训练过程总训练轮数为80,保存模型频率为每5轮保存一次。损失函数包括判别器损失、生成器损失、特征匹配损失、梅尔频谱损失和KL散度损失。
训练结果显示,初始损失中判别器损失为4.412,生成器损失为3.117,特征匹配损失为9.696,梅尔频谱损失为31.712,KL散度损失为8.056。最终损失中,判别器损失为3.519,生成器损失为3.859,特征匹配损失为10.658,梅尔频谱损失为17.800,KL散度损失为0.966。
本次实验通过80轮的训练,模型在各项损失上都有显著的下降,尤其是梅尔频谱损失和KL散度损失,表明模型在生成音频的质量和稳定性上有了较大的提升。实验使用了预训练模型,并在训练过程中定期保存模型状态,以确保训练的稳定性和可恢复性。
RVC-Project. (2024). Retrieval-based Voice Conversion WebUI. Retrieved from https://github.com/RVC-Project/Retrieval-based-Voice-Conversion-WebUI
Comments
万万没想到真出了以后发现…跟这个差不多
♥ 5 ↩ 1
虽然模型表现很优秀,但是数据集小的话需要更多的训练轮数。数据集中未出现过的音高生成不出来,因此训练集需要包含所有可能的音域。感觉最后效果不是非常还原,但是混音之后听起来区别变小了。
♥ 2
老师加油!特别喜欢您调的摩柯!
♥ 1
仙品选曲[原神_哇]
UP主加油!看好你噢~
好好好好好!!!!
柯味好浓[星星眼]
每当有新视频我就会在下面爬过,爬~爬~爬~