Transformer中的注意力机制,一步步讲解 | 深度学习 第6章 - 3Blue1Brown - 中配
合集 · 神经网络 - 3Blue1Brown (10)
-
但什么是神经网络?| 深度学习 第1章 - 3Blue1Brown - 中配
36:03
-
梯度下降:神经网络如何学习|深度学习 第2章 - 3Blue1Brown - 中配
40:38
-
反向传播,直观理解 | 深度学习 第3章 - 3Blue1Brown - 中配
24:58
-
反向传播的微积分|深度学习 第4章 - 3Blue1Brown - 中配
19:59
-
大语言模型简要解释 - 3Blue1Brown - 中配
15:42
-
Transformer:大语言模型背后的技术 | 深度学习 第5章 - 3Blue1Brown - 中配
53:37
-
Transformer中的注意力机制,一步步讲解 | 深度学习 第6章 - 3Blue1Brown - 中配
51:54
-
大语言模型可能是如何存储事实的 | 深度学习 第7章 - 3Blue1Brown - 中配
44:29
-
但交叉熵是什么?|压缩即智能 第2部分 - 3Blue1Brown - 中配
1:06:34
-
但AI图像和视频实际上是如何工作的?| Welch Labs 客座视频 - 3Blue1Brown - 中配
1:12:45
Parts
Description
3Blue1Brown 从 2017 年论文《Attention Is All You Need》出发,用“形容词修饰名词”的简化例子,一步步拆解注意力头如何把上下文融入每个 token 的嵌入表示。片中讲解查询、键、值向量与点积、Softmax 如何计算注意力模式,用掩码阻止后续 token 影响前面,再以加权和更新嵌入;并扩展到多头注意力、自注意力与交叉注意力、低秩映射和参数规模,最后指出并行化是 GPT-3 等大模型成功的关键。 ---------------------------------------------------------------- 00:00:00 嵌入回顾 00:01:41 动机示例 00:04:29 注意力模式 00:11:02 掩码 00:12:36 上下文大小 00:13:03 数值 00:15:38 参数统计 00:18:08 交叉注意力 00:19:07 多头 00:22:00 输出矩阵 00:23:00 深入探讨 00:24:29 结语 ---------------------------------------------------------------- 原标题:Attention in transformers, step-by-step | Deep Learning Chapter 6 原作者:3Blue1Brown 发布日期:2024-04-07 视频链接:https://www.youtube.com/watch?v=eMlx5fFNoYc
Comments
不得不说——《Attention Is All You Need》这论文标题起得真绝。
♥ 1
上一章在哪里
观看英文版请跳转至P2