十分钟揭秘DeepSeek原理,通俗易懂的大语言模型科普!
Description
新年期间,Deepseek可谓是掀起了全球AI热潮。 但很多小伙伴苦于被各种术语搞得头晕眼花,所有本期视频从科普角度出发,用各种例子为您解答: 大语言模型的工作原理?它是怎么训练出来的?以及Deepseek的研究人员是如何让它这么厉害的? 视频制作不易,恳请三连支持!
新年期间,Deepseek可谓是掀起了全球AI热潮。 但很多小伙伴苦于被各种术语搞得头晕眼花,所有本期视频从科普角度出发,用各种例子为您解答: 大语言模型的工作原理?它是怎么训练出来的?以及Deepseek的研究人员是如何让它这么厉害的? 视频制作不易,恳请三连支持!
Comments
已经倒了up主的模,想要的加群私信[doge]
♥ 104 ↩ 13
很好的科普,是我的大脑旋转(不是) 几个补充的点: 1. 视频中的编码器-解码器:这是Transformer模型结构中的两个重要组成部分。但是,现今流行的大语言模型通常使用**仅解码器(Decoder-only)模型,**,因此没有编码器部分。 2. “误差”:虽说“误差反向传播”里叫误差,不过实际一般叫“损失”(Loss)。现实场景中,计算两个token损失之间的方法,一般是交叉熵损失(Cross Entropy Loss),具体算法为,将真实的词语进行one-hot编码——例如词汇表中有4个词,我们需要编码的词是第二个,那就编码为(0,1,0,0);如果是第三个则是(0,0,1,0)。对one-hot编码和模型输出的概率分布,在这两者间计算交叉熵损失。 其中,概率分布:模型的原始输出实际上并不是“一个token”,而是它所计算的,词汇表中每一个token在下个词出现的概率,例如输出(0.1,0.4,0.3,0.2),就代表模型认为下一个token应该是词汇表里第二个词的概率是40%。而交叉熵损失的计算过程,则是先找到词汇表中,“真实token”(也就是文本中的token)是第几个,然后找到模型输出的概率分布中,这个token的概率(例如0.2),然后对这个概率取负对数(和pH有点像),例如-log(0.2)=0.7,那么交叉熵损失就是0.7 3. 反向传播:求导的一种方法。我们如何根据损失,来调整模型的参数呢?比方说,我们可以将某一个参数增加一点点,运行一遍模型,看看损失更改了多少。那么,如果损失增加了,就说明我们应该减少这个参数的值,如果损失减少,就说明我们应该继续增加这个参数。具体增加或减少多少取决于学习率,这是一个“超参数”(模型参数之外的参数),由研究者手动设置。刚刚的做法属于微分求导,运行一次模型只能调整一个参数。而反向传播则通过计算图,一次可以调整所有的参数,因此在实际训练中被应用。
♥ 83 ↩ 5
我们老师上课介绍deepseek放了这个,我差点在底下笑死
♥ 76 ↩ 9
我是小白,我看懂了[Mygo表情包_Love]
♥ 66 ↩ 4
那么问题来了,目前市面上的所有大语言模型都是Transformer模型,既然是Transformer模型,就必定符合Transformer的缩放理论,投资指数倍增长,获得的成果为线性提升,这个缩放理论是目前已经被事实证明过的,到目前我只所有以Transformer模型的大语言模型都符合Google提出点缩放定律,除了deepseek宣称他们只用了500万美金,如果按照缩放定律,要想获得一个像deepseek这样的仅次于openai的模型光硬件成本必过亿。我并不是质疑deepseek,因为科学的精神就是怀疑一切,人类所有的公理定理都只可视为目前有效,所以Google的缩放定律并不能说名为绝对正确。但是deepseek作为一个开源模型,同时又发表了论文,大家都能看到他们使用的所有技术都不是首创,都是人类在大语言模型领域已经有的技术,这就奇怪了,如果真如他么说的那样把大语言模型的成本降低了百倍,并可以被复制的定律,那么这不单是国运级别的,而是人类命运级别的发现。可是到目前为止,并没有看到deepseek公司任何的关于反驳现有缩放定律并提出新的缩放定律的论证。
♥ 59 ↩ 9
我在千年使用DeepSeek,结果提示服务器繁忙,不进行本地部署的它到现在已经成为千年的第八大千禧难题[doge]
♥ 57 ↩ 5
一定要用这些奇奇怪怪的配音吗。。
♥ 29 ↩ 6
大制作,肉眼可见的动画进步
♥ 20 ↩ 1
不知道自己是如何运行的的爱丽丝是屑[蔚蓝档案静态_开心]
♥ 19 ↩ 4
这条我问了他15分钟,天呐服务器,究竟在经历什么[千恋万花表情包_心碎]
♥ 18 ↩ 4
Deepseek总是提示服务器繁忙怎么办[笑哭]
♥ 14 ↩ 7
这就是deepseek的实力喵(现在已经被代码限制了 但是已经成品的就没有问题)(其实用api也可以)
♥ 13 ↩ 3
[doge]明显是看不懂啊
♥ 12 ↩ 3
嗯,AI当中的数学向量,有个更通俗的解释,他就相当于给每个物体他们之间的关系做比较。 。 举个例子,在一个y动物和x植物的坐标系中,苹果就更接近x,香蕉也接近x,但不会以苹果重合,而人类更接近于y。苹果和香蕉的坐标系距离更近,他们具有更强的相似性,向量可以解释他们的位置,AI就能理解,苹果,香蕉,人类的相关性。输入苹果AI就能联想到香蕉,然后输出香蕉,而不会输出人类。 。 当然在实际情况下,可不单单只有这两三个维度,还有更多复杂的情况
♥ 12 ↩ 1
感觉AI是一种可以把语文和数学连在一起的东西,礼教和教育词语,将可以用数学的向量表示,能不能解释一下他是怎么把文字化成向量的?
♥ 11 ↩ 4
原理:把文本转化为数字,使计算机能理解; 过程:转化为数字或向量,称为token,通过任务的计算,把token转化为另一串token,再通过分词器翻译出来...
♥ 11
奇怪了,感觉视频挺好的呀,剪辑动画也都那么丝滑,爱丽丝小桃她们那么可爱,科普也很好理解,受众广,怎么这流量连万都没有[千恋万花表情包_害羞]
♥ 9
师范生看完模型学习不明觉厉,原来模型也是人,一样的强化学习[少女乐队的呐喊表情包_倔]
♥ 9 ↩ 1
[Mygo表情包_让我看看]
♥ 9
那请问牛肉那一种类型的 又是怎么样的原理呢[星星眼]
♥ 7 ↩ 4