【yoko】歌声采样UTAU CVVC音源展示 銀の龍の背に乗って

Description
銀の龍の背に乗って  中岛美雪
演唱:yoko UTAU CVVC
音源制作/调混:白烁 (低创致歉)

使用完整的HTS-demo_NIT-SONG070-F001开源歌声数据集,时长约为30min
由于数据未覆盖全部常用CV/VC音素组合,使用了yoko的DiffSinger声库添加合成数据补充缺失发音
工程使用无参ust + DiffSinger yoko 自动音高

这一音源充分说明了歌声采样utau对数据量有较高的要求。歌声数据字内演唱变化大,移调与拉伸会严重放大这些不稳定的区段。从这一稿中容易听出一些由于音高/长度偏移过远而导致的瑕疵。30min日语歌声不足以覆盖常用发音,也不能分布于所有音高区间。
所幸DiffSinger合成数据转换为utau oto的方法已经趋于完善,未来可能直接用于ds到u的声库转制。

ust:https://bowlroll.net/file/353933
编辑器:OpenUtau-CustomRenderer
https://github.com/xiaobaijunya/OpenUtau-CustomRenderer
渲染器:HiFiUTAU-engine
https://github.com/xiaobaijunya/HiFiUTAU-engine
音素器:自制JA CVVC Romaji (Contributed by DeepSeek)
数据集:HTS-demo_NIT-SONG070-F001 (标注 by 白烁)
https://hts.sp.nitech.ac.jp/

Comments

立葵_Tachi 9d ago

这是什么技术啊!?好真人的效果[打call][打call]

♥ 3

幽寂 9d ago

前段时间刚刚看人介绍过这个方法。只是如是我感到AI采样通常的形式和UTAU的需求是不一样的:AI大概希望一些发散性,而UTAU大概希望尽量稳定收束?

♥ 3 ↩ 1

Kakaru-kh 9d ago

某种新时代人力(

♥ 3

扣分了出音味来全责 8d ago

感觉效果像sv的std声库

♥ 2

琴师Hxpstz 9d ago

希望diffsinger以后有意大利语和德语的美声声库

♥ 1 ↩ 4

喋北_Choukita 9d ago

确实覆盖率来说30min是非常短的数据集了 但真要谈覆盖率的话,只用一种ai采样的思路,时长一多体感上又容易边际递减

♥ 1

黑篙 9d ago

强强[mujica夜愿华章表情包_点赞]