IndexTTS2 更新3 社区开源vllm版本 至少3倍加速 B站开源超强音频克隆
合集 · IndexTTS (5)
-
IndexTTS2 一键包 B站超强音频克隆更新啦 8G显存可用 支持旧显卡 支持50系 在情感表达和时长控制方面取得突破的自回归零样本文本合成系统
1:00
-
IndexTTS2 一键包更新 更新deepspeed 更新cuda kernel B站开源超强音频克隆 8G显存可用 支持旧显卡 支持50系
1:00
-
IndexTTS2 一键包更新2 降低占用 8G显存可用 B站开源超强音频克隆 支持旧显卡 支持50系
1:01
-
IndexTTS2 更新3 社区开源vllm版本 至少3倍加速 B站开源超强音频克隆
0:47
-
IndexTTS2 更新4 社区开源vllm版本 windows一键包 不使用wsl B站开源超强音频克隆 16G显存可用 支持50系
1:05
Description
https://www.compshare.cn/images/mbu1nCYVfl9E?referral_code=CtG1EfsQUrBCQXiNn88qge&ytag=GPU_YY-bl_SZY
Comments
Win上花了好久修各方面的代码从头编译vllm轮子终于跑通了,确实牛逼,提速接近一倍啊 (4090laptop并非4090桌面版,是4080的核心,理论性能大约只有桌面4090的60%)
♥ 9 ↩ 24
云端:https://www.compshare.cn/images/mbu1nCYVfl9E?referral_code=CtG1EfsQUrBCQXiNn88qge&ytag=GPU_YY-bl_SZY 一键包详见数列的视频,支持vllm,速度更快,支持关闭情感模型,显存占用更低 BV1nhW6zoES4 请不要在置顶评论回复,会定时删除~
♥ 5
发现了个非常奇怪的现象,deepspeed对于短音频确实有加速,但是长音频反而倒退,比默认慢了一倍,不知道是不是注意力实现不适合消费级显卡的原因,以及模型还不支持cuda graph。这么一看vllm虽然可能没有3倍那么夸张但的确加速效果很好(4090+vllm RTF0.27,5090全默认0.37)
♥ 3 ↩ 6
[打call]
♥ 1
大佬,我今天生成了长文本(一万字左右)我发现很多时候,在个别句子的末尾,会有一个突兀的声音出现,不知道怎么能解决这个问题?就是朗读到句子的结尾会有一声不属于文本的那种生成,很短暂突兀,有什么解决办法吗?望回复
↩ 2
大佬能打个docker版本吗?谢谢!
↩ 2
vllm加速的V2版本rtf还是比之前V1.5 要高一点的
↩ 1
跟cosyvoice对比怎么样
↩ 3
支持固定时间长度吗
↩ 4
刚准备把wsl关了 咝 要不 算了 在等等windows版吧 大佬加油啊
↩ 3
需要多少显存?
↩ 2
上免费云呀
↩ 2
感谢大佬,方便加个多角色配音吗[打call]
↩ 2
能生成日语吗
挺好的,我就是linux,过两天试试
↩ 1
就等你的更新了,前两天还想问[呲牙]
↩ 3
现在只能linux是吧
↩ 3
https://b23.tv/BV1vwR5YgEFp