【徵羽摩柯AI】ルーマー / Rumor / 谣言

合集 · 人工智障 (4)

  1. 2:59
    【徵羽摩柯AI】ルーマー / Rumor / 谣言
  2. 3:16
    【攻科大队长AI】Dehors
  3. 4:27
    【赛博神医 妙手回春】soulpower陶喆献唱拉跨版小镇姑娘
  4. 3:03
    IfWeHaveEachOther_HiRes
Description
在本实验中,数据处理部分采用了48000 Hz的采样率,梅尔频谱参数设置为128个梅尔频谱通道,最小频率为0 Hz,最大频率未指定。窗口长度为2048,跳跃长度为480,最大波形值为32768.0。
模型架构方面,过滤通道数为768,隐藏通道数和内层通道数均为192,卷积核大小为3,层数为6,注意力头数为2,丢弃率为0。残差块为类型1,膨胀大小为[[1, 3, 5], [1, 3, 5], [1, 3, 5]],卷积核大小为[3, 7, 11]。上采样初始通道数为512,上采样卷积核大小为[24, 20, 4, 4],上采样率为[12, 10, 2, 2],未使用谱归一化。
训练设置中,批量大小为8,优化器参数为β1=0.8, β2=0.99, ε=1e-09,初始学习率为0.0001,学习率衰减为0.999875,训练轮数为20000,日志间隔为每200步,使用FP16,并使用了预训练的生成器和判别器模型。
训练过程总训练轮数为80,保存模型频率为每5轮保存一次。损失函数包括判别器损失、生成器损失、特征匹配损失、梅尔频谱损失和KL散度损失。
训练结果显示,初始损失中判别器损失为4.412,生成器损失为3.117,特征匹配损失为9.696,梅尔频谱损失为31.712,KL散度损失为8.056。最终损失中,判别器损失为3.519,生成器损失为3.859,特征匹配损失为10.658,梅尔频谱损失为17.800,KL散度损失为0.966。
本次实验通过80轮的训练,模型在各项损失上都有显著的下降,尤其是梅尔频谱损失和KL散度损失,表明模型在生成音频的质量和稳定性上有了较大的提升。实验使用了预训练模型,并在训练过程中定期保存模型状态,以确保训练的稳定性和可恢复性。
RVC-Project. (2024). Retrieval-based Voice Conversion WebUI. Retrieved from https://github.com/RVC-Project/Retrieval-based-Voice-Conversion-WebUI

Comments

TRANSTORM幻化风 2024-09-12

万万没想到真出了以后发现…跟这个差不多

♥ 5 ↩ 1

攻科大队长 2024-08-19

虽然模型表现很优秀,但是数据集小的话需要更多的训练轮数。数据集中未出现过的音高生成不出来,因此训练集需要包含所有可能的音域。感觉最后效果不是非常还原,但是混音之后听起来区别变小了。

♥ 2

陶柯keeeer 2024-08-23

老师加油!特别喜欢您调的摩柯!

♥ 1

猜我里面什么馅 2024-09-13

仙品选曲[原神_哇]

Xwei1645 2024-08-25

UP主加油!看好你噢~

黑羽小夜 2024-08-23

好好好好好!!!!

爪鱼灯 2024-08-20

柯味好浓[星星眼]

御坂美团 2024-08-19

每当有新视频我就会在下面爬过,爬~爬~爬~