米糊没米 2024-05-19 两个秩为 1 的矩阵乘起来怎么可能变成 3 的矩阵 矩阵相乘秩不等式了解一下..视频里举的那个由两个秩为 1 矩阵相乘的三阶矩阵明显就是秩为 1 的矩阵 不要误人子弟啊 ♥ 187 ↩ 8
汪名毁 2024-06-15 讲的很通俗易懂,再配合动画,绝了。这里推荐可以,先科普微调的概念以及基本方法,然后再过度到LoRA会好一点,还可以在最后讲解一下使用LoRA来微调,会给原有模型带来怎么样的改变。 ♥ 38 ↩ 1
BestGu米一 2025-10-28 视频里问题挺多,LoRA核心思路是“一个训练完成的模型适配新任务时它的权重矩阵的值的改变通常是低秩的“。基于这个思路,在原模型上增加低秩权重矩阵,例如原模型的一个线性层很可能是2^12*2^12这样形状的矩阵,但有了上诉理论基础,确定了哪怕使用低秩矩阵不会损失太多信息之后,便可增加两个矩阵,一个2^12*x,一个x*2^12,通常x远小于2^12。对比一下,原线性层权重矩阵的秩≤2^12,而新矩阵的秩≤x。以确保输入输出矩阵的形状不会发生改变,同时所需要的储存空间以及运算力要求也大大降低。同时用新的数据训练时确保基模各层权重不变,仅修改Lora模型的权重,这也是为什么一个Lora通常只能用于一个固定的原模型上面,换一个基础模型可能会失效。如两个基础模型内部权重差距过大,在一个基模上训练的Lora模型可能会在另一个基础模型上失去作用。 ♥ 31 ↩ 4
Comments
我还以为是无线通信的LoRa[脱单doge]
♥ 413 ↩ 23
两个秩为 1 的矩阵乘起来怎么可能变成 3 的矩阵 矩阵相乘秩不等式了解一下..视频里举的那个由两个秩为 1 矩阵相乘的三阶矩阵明显就是秩为 1 的矩阵 不要误人子弟啊
♥ 187 ↩ 8
我以为是“LoRa”(Long Range Radio)呢。。。。。。。
♥ 156 ↩ 8
[打call]听不懂,我还以为Lora(lorawan),哈哈哈
♥ 73 ↩ 5
不是啊,我想看大模型的lora,不是AI绘图的lora
♥ 48 ↩ 3
讲的很通俗易懂,再配合动画,绝了。这里推荐可以,先科普微调的概念以及基本方法,然后再过度到LoRA会好一点,还可以在最后讲解一下使用LoRA来微调,会给原有模型带来怎么样的改变。
♥ 38 ↩ 1
视频里问题挺多,LoRA核心思路是“一个训练完成的模型适配新任务时它的权重矩阵的值的改变通常是低秩的“。基于这个思路,在原模型上增加低秩权重矩阵,例如原模型的一个线性层很可能是2^12*2^12这样形状的矩阵,但有了上诉理论基础,确定了哪怕使用低秩矩阵不会损失太多信息之后,便可增加两个矩阵,一个2^12*x,一个x*2^12,通常x远小于2^12。对比一下,原线性层权重矩阵的秩≤2^12,而新矩阵的秩≤x。以确保输入输出矩阵的形状不会发生改变,同时所需要的储存空间以及运算力要求也大大降低。同时用新的数据训练时确保基模各层权重不变,仅修改Lora模型的权重,这也是为什么一个Lora通常只能用于一个固定的原模型上面,换一个基础模型可能会失效。如两个基础模型内部权重差距过大,在一个基模上训练的Lora模型可能会在另一个基础模型上失去作用。
♥ 31 ↩ 4
在毕业后终于能把线性代数真正理解到应用里 感谢up
♥ 34 ↩ 3
矩阵相乘不是要左边矩阵的列数等于右边矩阵的行数吗?这里错了吧?
♥ 19
从这个视频就能看出来本科率了[笑哭]
♥ 19 ↩ 5
看不懂的等上大学上完线性代数再看,上过大学的那就默认你是文科生
♥ 21 ↩ 2
俺们村现在情况是会用即是仙,看懂就是神,搜索一下资料就是专家[doge]
♥ 17
这里只讲了什么是lora吧,没说lora原理,原理应该是为什么这么做
♥ 9 ↩ 7
脑子懵了一下,还以为是ReLU
♥ 9
真的我看弹幕还有说难的,这都嚼碎了拿导流管倒胃里了,真的觉得难只能说不适合学这个好吧唉
♥ 13 ↩ 11
这不是个无线协议?[doge]
♥ 6 ↩ 1
lora论文里面给出的dim都是1到4的。[吃瓜]
♥ 4 ↩ 5
lora 训练代码,先降维,再升维,是什么意思?
♥ 4 ↩ 3
Long Range Radio[doge]
♥ 3 ↩ 1
up讲的太好了我的天……几分钟就给我一个啥都不懂的新人给讲通了。她正在试图教会我,哎,还真是[某科学的超电磁炮T_呆住]
♥ 2