Description
感谢@--头头头头头头头-- @小日向美香的传声筒 @Yukikiyo_H 在视频制作中给予的帮助!
感谢Uncle城开源的AI_Animation工具!
安装finesub命令行:
powershell -ExecutionPolicy ByPass -c "irm https://raw.githubusercontent.com/caca2331/finesub/main/cli/install.ps1 | iex"
【相关链接】
开发者:@--头头头头头头头--
FineSub 开源项目:
https://github.com/caca2331/finesub
Google AI Studio(创建 Gemini API Key):
https://aistudio.google.com/apikey
字幕组 AI 研讨中心入口群:
QQ群 1103800816
【使用前注意】
1. 建议使用 NVIDIA 显卡,显存 4GB 以上;不支持的显卡可能回退到 CPU,速度会慢很多。
2. 首次运行会按需下载运行环境和模型,请预留时间和磁盘空间。
3. Gemini API 提供免费额度,但不是无限使用,实际额度以当时的官方页面为准。
4. 不要公开自己的有效 API Key,也不要发到视频、评论区或群聊里。
5. AI 生成的字幕不能代替人工校对,尤其要检查人名、专有名词、多人抢话和游戏声音盖住人声的部分。
Comments
离我被丢进垃圾桶不远了(
♥ 76 ↩ 4
这集神了[魔法少女的魔女审判表情包_大力捏爆!]
♥ 70 ↩ 1
我自己做翻译切片一年多了,一直用potplayer装上插件使用faster-whisper-large-v3-turbo模型进行日语语音识别,把输出的字幕再拿给网页deepseek翻译。我自己能看个大概懂,然后把有意思的地方切出来发给朋友校对。 我觉得最重要的还是语音识别模型要准,我自己用的时候识别总有点细节问题,时间长了还会有大段空白没识别,声音小了也识别不了,这一步过不了后面都干不了。时间轴的话,几乎没感觉到问题,毕竟我不需要每一句都很准,只要我切的几分钟准就可以了。 一年了我都没更新工具和技术,主要还是感觉提升不大,就一直没去搞
♥ 2 ↩ 2
感谢大佬开源,我前几个月也在做一个类似的项目,没想到竟然不谋而合了。https://github.com/MelanLee-shadow/bilibili-vtuber-clip。这个项目的目的是用来做全自动带字幕切片,因为想要全自动,目前只有cli版,没有考虑gui,而且大部分基于api key调用。不占用本地gpu。目前项目关注的是国v,用到了bcut的接口,实测听写中文准确率比Gemini 高很多。如果有兴趣也可以换能听日语的模型,就能给日语做切片了。最近微软新出了一个MAI2模型,似乎日语听力很不错,比Gemini强。虽然关注的是中文,但是也遇到了同样的问题,就是需要专名处理,专有名词是一个很难搞定的问题,目前也在一直克服中,主要是依靠一个新闻爬虫收集最新专名,以及依靠后处理LLM根据专名文件和听音内容进行推理猜测校正。另一个大的功能就是读弹幕,读画面内容的精准匹配和重现,目前实现的还可以。但是还剩一个很难的难题是说话人分离,有的时候,如果画面中观看的内容发出声音,主播也发出声音,只要进行说话人分离就能很好的隔离开,不需要多余的语意处理。以及说话人分离还能应用于多主播场合。可惜说话人分离技术目前好像不是很强大,错误还是很多,不知道大佬怎么处理的。
♥ 4 ↩ 1
是whisper...这个模型烂的要命哎,就算用qwen1.7都好呀
♥ 1 ↩ 4
这么牛逼的东西竟然是免费的吗,已严肃学习
♥ 5
其实最难的还是多人音色识别[笑哭][笑哭][笑哭]
♥ 4
我超,我搓的烤肉机错误还满天飞呢。这视频共创还有传声筒,看来我真得学一个了
♥ 8 ↩ 1
我的烤肉机也快做出来了 群号怎么搜不到
♥ 21 ↩ 1
前几天搓了个半成品现在看来是不用搓了[魔法少女的魔女审判表情包_哦吼吼]
♥ 8 ↩ 2
可否接入其他asr的api
♥ 1
这也有yuno听哦[梦限大_由乃坏笑]
♥ 14
绝对的强大,如此而生的孤独,教会你烤肉的是……
♥ 3
插个眼,虽然不一定会用上。
♥ 3
试试看[Mygo表情包_探头][Mygo表情包_探头][Mygo表情包_探头]
♥ 1
压力马斯内[喜欢][喜欢] 越来越多东西辅助加快速度了
♥ 3 ↩ 1
@MilkyAi 发到我邮箱
♥ 2
绝对的强大,如此而生的孤独,教会你烤肉的是……
♥ 2