【攻科大队长AI】Dehors

合集 · 人工智障 (4)

  1. 2:59
    【徵羽摩柯AI】ルーマー / Rumor / 谣言
  2. 3:16
    【攻科大队长AI】Dehors
  3. 4:27
    【赛博神医 妙手回春】soulpower陶喆献唱拉跨版小镇姑娘
  4. 3:03
    IfWeHaveEachOther_HiRes
Description
本实验旨在训练一个基于深度学习的语音生成模型。实验使用了特定的音频数据集,并通过调整模型参数和训练策略,优化了语音生成的效果。
数据集的采样率为48000 Hz,滤波长度为2048,跳跃长度为480,最大波形值为32768.0。梅尔频率的最小值为0.0,最大值未设定,通道数为128,窗口长度为2048。
模型参数方面,滤波通道数为768,GIN通道数为256,隐藏通道数和中间通道数均为192,卷积核大小为3,注意力头数为2,层数为6,丢弃率为0。残差块类型为1,膨胀大小为[[1, 3, 5], [1, 3, 5], [1, 3, 5]],卷积核大小为[3, 7, 11]。说话人嵌入维度为109,上采样初始通道数为512,卷积核大小为[24, 20, 4, 4],上采样倍率为[12, 10, 2, 2]。是否使用谱归一化为否。
训练参数包括批次大小为8,Adam优化器的β参数为[0.8, 0.99],KL散度系数为1.0,梅尔频谱损失系数为45,训练轮数为20000,学习率为0.0001,学习率衰减为0.999875,初始学习率比例为1,日志记录间隔为200,随机种子为1234,片段大小为17280,是否使用FP16为是。GPU编号为0,是否缓存数据到GPU为否。
训练过程总训练轮数为80,每轮保存模型。

Comments

霞露竹翎 2024-08-19

[打call][打call][打call][打call][打call]

♥ 1

攻科大队长 2024-08-19

这个声音听起来和我简直一模一样

♥ 1