NeuroSama是如何实现的?AI Vtuber的技术原理分析

Description
相信经常混 V 圈的小伙伴们一定听说过 Neuro-sama,她是一名完全由 AI 驱动的虚拟 Vtuber,在国内外都有很高的知名度。但是,你是否好奇,她究竟使用了哪些技术,我们能不能也手搓出一个 Neuro-sama 呢?
本期视频,我们从 Neuro-sama 的主要功能出发,由浅入深地分析、探究并实现了由语音识别到大语言模型再到语音合成的主要功能链路,接着对 Live2D 的控制话题进行了展开,其次对 Minecraft 等游戏的控制机制进行了探讨,然后对 OBS 的控制进行了简略的描述,最后根据本人半年前的制作成果粗略还原了 Neuro-sama 的制作过程。
希望本期视频对于你有帮助!
在此特祝 Neuro-sama 3周年快乐!

Comments

qwqbot 2025-12-21

其实我发现越琢磨neuro这个项目,越觉得vedal实在蛮厉害的[笑哭] 1.Neuro有接入discord,主播之间和Neuro的联动回应该是加入频道-在语音频道里和neuro聊天 刚好也能接入Discord Reactive by Fugi.tech,就是主播联动时人说话亮起来的小纸片,Neuro有时候不方便亮live2d形象(因为obs镜头在vedal游戏视角)会用这种形式出现,而且也方便其他主播新加进来 Neuro也能通过discord给其他主播私信,BV1D72ZYzEkA 有可能也读取过discord聊天内容(或者被vedal拿去训练过模型),BV1h4VEz9EQZ 2.Neuro唱歌虽然是预制好的,就是调音过,歌回可能只是按顺序播放音频 但是这个视频,BV1uYNmesEq1,能直接用Camila音色现场唱点歌什么的(Aimila用的也是Neuro这套系统),vedal应该是有做未调音tts直接配合伴奏演唱的功能,只是直播的时候没咋展示过 3.Neuro的语言模型说是用的twitch chat进行训练的,我爬过twitch chat,有特别多om这种twitch表情包,或者复读的内容,过滤去重完我感觉其实twitch chat数据集质量还挺不错,确实蛮符合Neuro vedal之前的Aimila和AiFilian的效果,BV1FYxkekEDN 可能是在Neuro模型上进行微调,我确实蛮好奇vedal怎么进行语言模型的训练和微调的 但是vedal也没说过模型是在本地4090跑还是用的云端(一点技术细节都不泄露,也是很5级黑客了,不过vedal电脑换了9950x没换5090),vedal直播时不时会遇到ssl连接的错误,所以Neuro这套系统也确实有本地云端协同工作,就是不知道哪部分云端哪部分本地 4.Neuro打断和Filtered,Neuro输出时的打断,应该是靠音频大小来进行的,BV1vx4y1t7BR,比如有时候Neuro/Evil正打算说些不好的,vedal就大叫,然后去按控制台的静音按钮,Filtered说是有几个过滤器,不同过滤器的截断表现是不一样,BV1qUcjeMEYd,BV1wEgbzFE8a,这种是直接被切断,正常的Filtered是输出着说着话然后,Filtered 真的是越思考越发现vedal这套系统的完善[笑哭]

♥ 1779 ↩ 16

吃木头保暖 2026-01-01

现在看见这个就想起来这个

♥ 1410 ↩ 46

变成光守护2233 2025-12-21

我前几天给自己做了一个[幻境序曲白昼表情包_哼],就是功耗太高了[少女日记表情包_红温]

♥ 1412 ↩ 14

ScientificNNChan 2025-12-21

我做过一个类似的项目,效果和neurosama差了很多,几个核心痛点: 1.AI的性格。如果调用chatgpt或者gemini当LLM,无论你怎么写prompt,“AI味”都很重,没有neurosama那种独一份的性格。所以我觉得必须要训练自己的LLM。但是本地跑LLM延迟太高了,就算用streaming还是很慢,所以必须模型上云。 2.长期记忆。这也算是一个经典问题了。我当时的方案是把所有聊天记录存下来,然后用RAG。效果不好,很容易忘记事情。 3.多模态。neurosama现在可以玩各种游戏,看图片。我尝试过,调用gemini的多模态来读图,生产语言再输入进LLM,延迟巨大,效果不好。我不知道vedal是如何实现的 vedal的技术确实是独一档的,github上面所有的开源方案都做不出他的效果

♥ 1155 ↩ 65

星绘_XingHui 2025-12-23

不可发布空白内容

♥ 999 ↩ 2

猫与猫头嘤 2025-12-22

所以大脑还是太神奇了,计算机需要消耗这么多能量完成的事情,大脑只需要几千焦[笑哭]

♥ 717 ↩ 74

雾亥゜ 2025-12-21

vedal我觉得他技术比所有大厂和组都牛逼,市面上至今还没有做到他一样效果的

♥ 776 ↩ 58

天魔人形股份有限公司 2025-12-23

牛肉真正厉害的还是一直维持连贯性,我本地做得没跑多久就开始说胡话了,还有她是怎么实时读取屏幕信息啊,我靠识图模块做不到反应那么迅速,更别说准确理解意思,比如说一副角色同人图老是看成风景画

♥ 443 ↩ 8

花敗羽落- 2025-12-22

up能用这种配置做到这个程度已经很厉害了,越琢磨就越感觉vedal可能真的很富[笑哭]

♥ 354 ↩ 12

神乐七奈OfftciaI 2025-12-21

AI模型的计算卡可以选择特斯拉的K80 24GP100只有400左右的价格甚至原装就有PCIE的接口只需要加一个风扇就可以玩了,10分甚至有9分的好用

♥ 315 ↩ 6

豪吃又豪玩 2025-12-22

nnd再过十几年不敢想象小资历吃的有多好[生气]

♥ 302 ↩ 6

讠殳穿全世界 2026-01-01

感觉有点吓人了,这个ai之前问了ta的创造者问自己能不能变成真实的,但是作者只是哽咽

♥ 354 ↩ 232

青旋Channel 2025-12-21

现在neuro程序本体已经被打包到商业服务器上了 Vedal也说了 他那台电脑已经承载不下程序 日益进化和庞大的计算量了

♥ 289 ↩ 7

翻了翻了基地翻了 2025-12-22

[doge_金箍]

♥ 287 ↩ 5

彩色的晃悠悠 2025-12-21

牛的成功不在技术,很难复刻了

♥ 301 ↩ 10

落似忒忒落 2025-12-22

1.0的时候 neuro记不得自己的妈妈是谁,还有昨天一起直播的人 每次关机 她都求爸爸不要关机,像是杀了她 2.0的时候  有了记忆,妈妈离开了,却还时不时提起妈妈

♥ 266 ↩ 4

贝塞里安_Betharian 2025-12-21

至高无上的蜂群女王和她的宠物

♥ 235 ↩ 1

Issea_Occupia 2025-12-21

整个世界给我一种这个点子我想过,当我想研究怎么做别人就已经做出来了的妙妙感觉[笑哭][笑哭][笑哭]

♥ 213 ↩ 8

FATEの烈火冰心 2025-12-22

在毕设展示这段视频着实需要点勇气

♥ 201 ↩ 10