Transformer:大语言模型背后的技术 | 深度学习 第5章 - 3Blue1Brown - 中配

合集 · 神经网络 - 3Blue1Brown (10)

  1. 36:03
    但什么是神经网络?| 深度学习 第1章 - 3Blue1Brown - 中配
  2. 40:38
    梯度下降:神经网络如何学习|深度学习 第2章 - 3Blue1Brown - 中配
  3. 24:58
    反向传播,直观理解 | 深度学习 第3章 - 3Blue1Brown - 中配
  4. 19:59
    反向传播的微积分|深度学习 第4章 - 3Blue1Brown - 中配
  5. 15:42
    大语言模型简要解释 - 3Blue1Brown - 中配
  6. 53:37
    Transformer:大语言模型背后的技术 | 深度学习 第5章 - 3Blue1Brown - 中配
  7. 51:54
    Transformer中的注意力机制,一步步讲解 | 深度学习 第6章 - 3Blue1Brown - 中配
  8. 44:29
    大语言模型可能是如何存储事实的 | 深度学习 第7章 - 3Blue1Brown - 中配
  9. 1:06:34
    但交叉熵是什么?|压缩即智能 第2部分 - 3Blue1Brown - 中配
  10. 1:12:45
    但AI图像和视频实际上是如何工作的?| Welch Labs 客座视频 - 3Blue1Brown - 中配

Parts

  1. P1 · 配音
  2. P2 · 原声
Description
3Blue1Brown《深度学习》第五章从线性回归讲到ChatGPT等大语言模型背后的Transformer:输入被切成token、映射成向量,经过注意力模块和前馈网络,用softmax输出下一个词的概率;并以GPT-3为例说明参数规模。预训练与微调、反复预测与采样、系统提示词,以及嵌入空间、上下文长度、温度参数等概念也串联起来,为下一章讲注意力做铺垫。
----------------------------------------------------------------
00:00:00 预测、采样、重复
00:02:56 Transformer内部
00:06:21 章节布局
00:07:03 深度学习的前提
00:12:04 词嵌入
00:17:46 词之外的嵌入
00:19:43 解嵌入
00:21:44 带温度的Softmax
00:25:13 接下来
----------------------------------------------------------------
原标题:Transformers, the tech behind LLMs | Deep Learning Chapter 5
原作者:3Blue1Brown
发布日期:2024-04-01
视频链接:https://www.youtube.com/watch?v=wjZofJX0v4M

Comments

望天冲 3d ago

出一期思维链吧?没看懂这个概率模型怎么会有思维链?

给你机会你不中用吗 26d ago

观看英文版请跳转至P2

旁白_B 26d ago

强烈建议把语言向量运算那段做成短视频,-日本+寿司+德国=香肠,这例子绝了

旁白_B 26d ago

词元背后的含义被嵌入到一万两千维的空间里,还能用坐标和方向来表示关系,而且跨主题都成立,这也太离谱了。就像日本→寿司和德国→香肠是类似的关系,真的绝了

旁白_B 26d ago

希望这不是愚人节玩笑

金色的金涩 25d ago

无限猴子打字机