Transformer中的注意力机制,一步步讲解 | 深度学习 第6章 - 3Blue1Brown - 中配

合集 · 神经网络 - 3Blue1Brown (10)

  1. 36:03
    但什么是神经网络?| 深度学习 第1章 - 3Blue1Brown - 中配
  2. 40:38
    梯度下降:神经网络如何学习|深度学习 第2章 - 3Blue1Brown - 中配
  3. 24:58
    反向传播,直观理解 | 深度学习 第3章 - 3Blue1Brown - 中配
  4. 19:59
    反向传播的微积分|深度学习 第4章 - 3Blue1Brown - 中配
  5. 15:42
    大语言模型简要解释 - 3Blue1Brown - 中配
  6. 53:37
    Transformer:大语言模型背后的技术 | 深度学习 第5章 - 3Blue1Brown - 中配
  7. 51:54
    Transformer中的注意力机制,一步步讲解 | 深度学习 第6章 - 3Blue1Brown - 中配
  8. 44:29
    大语言模型可能是如何存储事实的 | 深度学习 第7章 - 3Blue1Brown - 中配
  9. 1:06:34
    但交叉熵是什么?|压缩即智能 第2部分 - 3Blue1Brown - 中配
  10. 1:12:45
    但AI图像和视频实际上是如何工作的?| Welch Labs 客座视频 - 3Blue1Brown - 中配

Parts

  1. P1 · 配音
  2. P2 · 原声
Description
3Blue1Brown 从 2017 年论文《Attention Is All You Need》出发,用“形容词修饰名词”的简化例子,一步步拆解注意力头如何把上下文融入每个 token 的嵌入表示。片中讲解查询、键、值向量与点积、Softmax 如何计算注意力模式,用掩码阻止后续 token 影响前面,再以加权和更新嵌入;并扩展到多头注意力、自注意力与交叉注意力、低秩映射和参数规模,最后指出并行化是 GPT-3 等大模型成功的关键。
----------------------------------------------------------------
00:00:00 嵌入回顾
00:01:41 动机示例
00:04:29 注意力模式
00:11:02 掩码
00:12:36 上下文大小
00:13:03 数值
00:15:38 参数统计
00:18:08 交叉注意力
00:19:07 多头
00:22:00 输出矩阵
00:23:00 深入探讨
00:24:29 结语
----------------------------------------------------------------
原标题:Attention in transformers, step-by-step | Deep Learning Chapter 6
原作者:3Blue1Brown
发布日期:2024-04-07
视频链接:https://www.youtube.com/watch?v=eMlx5fFNoYc

Comments

旁白_B 26d ago

不得不说——《Attention Is All You Need》这论文标题起得真绝。

♥ 1

你呀0007 1d ago

上一章在哪里

给你机会你不中用吗 23d ago

观看英文版请跳转至P2