【官方双语】直观解释注意力机制,Transformer的核心 | 【深度学习第6章】

Description
“塔”是什么?“Harry”是谁?怎么想象“一个毛茸茸的蓝色生物漫步于葱郁的森林”?怎样用12288个数字表示出一个细微复杂具体的含义?

大语言模型中的注意力机制并没有那么神秘。本视频重点介绍什么是多头/自/交叉注意力。

0:00 - 前情提要:词嵌入
1:39 - 注意力是什么? Mole是什么?Tower又是什么?
4:29 - 注意力模式:“一个毛茸茸的蓝色生物漫步于葱郁的森林”,名词与形容词,查询与键
11:08 - 掩码:看前不看后
12:42 - 上下文窗口大小
13:10 - 值矩阵:“蓝色”如何修饰“生物”?
15:44 - 参数有多少
18:21 - 交叉注意力
19:19 - 多头
22:16 - 输出矩阵
23:19 - 加深网络
24:54 - 结语

YouTube: eMlx5fFNoYc
----
其他资源:
Andrej Karpathy,从零开始手搓 GPT:YouTube: kCc8FmEb1nY
vcubingx 新开的系列视频:从底层开始理解语言模型的概念:YouTube: 1il-s4mgNdI

想真正弄清楚Transformer内部的大网络在做什么,推荐Anthropic的网页博文
transformer-circuits.pub/2021/framework/index.html
我就是读了他的一篇文章后开始想,输出矩阵乘以值矩阵,其实就是嵌入空间到自身的一个低秩映射。这样想之后,至少我的概念变得更清晰了。

机器学习编程、GPT相关的教程、在线编程练习、解答:www.gptandchill.ai/codingproblems

Brit Cruise @ArtOfTheProblem,语言模型的历史:YouTube OFS90-FX6pg

关于嵌入空间中方向含义的论文:arxiv: 1301.3781

Comments

MRAMUNcom 2024-05-04

可视化注意力,变形金刚的核心

♥ 1202 ↩ 25

星洛Starfall 2024-05-04

3b1b为什么是神,首先是犯下了讲不明白课之罪的大学教授()不知道有多少人和我一样深度学习全靠3b1b和各路油管大佬吊着

♥ 2288 ↩ 36

惊鸿Zz丶 2024-05-04

早两天发这视频我就不用给学生们讲attention和transformer了,直接放这个视频就行了,比我讲的回好多了[笑哭]

♥ 559 ↩ 7

天下棒棒哒 2024-05-04

注意力是什么?是我全程专注的看完这个视频[脱单doge]

♥ 594 ↩ 9

bili_85457366 2024-05-09

有无数的讲解视频,都是从熟练者的角度来看一个问题,这样永远也无法真正清晰地、透彻地解释一个概念。而3b1b的视频,总能以一个新颖的视角,并且全局性地,概括性地透析一个概念,并且使用生动的比喻,真正让人做到大彻大悟。

♥ 503 ↩ 5

FakeDoor314 2024-05-04

attention is all you need(雾)

♥ 359 ↩ 11

瀚海才不是海 2024-05-04

0:00 - 前情提要:词嵌入 1:39 - 注意力是什么? Mole是什么?Tower又是什么? 4:29 - 注意力模式:“一个毛茸茸的蓝色生物漫步于葱郁的森林”,名词与形容词,查询与键 11:08 - 掩码:看前不看后 12:42 - 上下文窗口大小 13:10 - 值矩阵:“蓝色”如何修饰“生物”? 15:44 - 参数有多少 18:21 - 交叉注意力 19:19 - 多头 22:16 - 输出矩阵 23:19 - 加深网络 24:54 - 结语

♥ 234 ↩ 2

拆瑞脆 2024-05-04

怎么突然腹泻式更新[笑哭][笑哭]

♥ 157 ↩ 10

芜湖老司羁 2024-10-14

这么一看网上的其他科普真的是臭鱼烂虾。。。。全部围绕self attention在讲,根本没讲清楚从词嵌入到输出的过程,导致理解就是局部的。早点看到这个视频就好了。

♥ 130 ↩ 1

CoSmic_MURP 2024-05-04

3B1B的深入浅出程度让他成为了科普界绝对的T0

♥ 141

旧时溯洄 2024-11-16

注意力我的的理解 总结成一句话是 站在每个单词的视角去算这个句子的加权求和值。为什么要站在每个词的视角去算呢?以“我是彩笔”这句话为例,站在我这个词的视角彩笔这个词很重要,因为他定义了我的身份,但是站在彩笔的视角,我这个词不是那么重要因为别人也可能是彩笔,我是彩笔说明不了啥,Q K 相乘就是在调配不同词之间的重要性或者说相关性 ,通过调配QK的权重就能得到每个单词视角的一组相关矩阵,V是这个句子的特征值,最后相关性矩阵和特征矩阵相乘就得到了每个单词视角的句子特征。

♥ 83 ↩ 1

失眠长蘑菇 2024-05-20

注意力差的表现就是像我一样刚点进视频就开始看评论区(

♥ 66 ↩ 5

秋叶散人 2024-05-18

太牛逼了,transformer真是集人类智慧结晶的艺术品!

♥ 74 ↩ 21

颗粒剂聚会 2024-05-04

前几天刚审了篇稿提到了注意力机制 自己查资料搞了半天没搞懂 今天就给我推了[星星眼]

♥ 70 ↩ 5

PSI-CMD 2024-05-13

我对transformer注意力机制的理解为:注意力层中,每个 token 的 update 过程是该 token 信息与句中其他 token 信息的平均,而注意力机制的核心在于设计一个可学习的标量作为加权平均系数。图注意力网络同理,都是设计一个标量,但是得到标量的方法不同。另外transformer 处理句子的过程中token之间关系可以视为完全图,所以对图引入位置编码后,可以交给transformer处理。

♥ 63

JasmineJ9966 2024-08-07

不知道是位民科还是智力障碍人士一直在发这种弹幕

♥ 55 ↩ 1

永远在深夜该多好 2024-05-04

你的下一个大学课堂何必在大学[doge][doge]

♥ 40

_南冥_ 2024-09-03

多头自注意力是对词嵌入维度进行head份拆分,然后每个头对不同的拆分结果进行自注意力计算然后拼接。 还是多个head对同一个完整的词嵌入进行不同的计算然后叠加。

♥ 36 ↩ 40

小鼻屎怪 2024-05-27

【希望能被顶上去或者置顶】 关于10:30左右的QK是否写反了的问题: 是的,视频中的Q和K向量是按列排的,所以正确形式为K(T)*Q。 这个问题3B1B在他的ytb频道下方有说明: "Also, one thing I should have called out more explicitly is how I personally like to think of vectors like embeddings, keys, queries, etc. as columns, and as a convention display them this way, but other sources, including the Attention is All You Need paper, may present them organized in a row-by-row fashion. This is relevant to parsing the equation shown at 10:29, where the expression from the paper that looks like Q K^T would, by the conventions of this video, instead look like K^T Q." 希望大家不要这个点上纠结,领会核心概念就好了。

♥ 36

咲时之夜 2024-05-04

你怎么知道我在写transformer的毕设

♥ 38 ↩ 10