Transformer:大语言模型背后的技术 | 深度学习 第5章 - 3Blue1Brown - 中配
合集 · 神经网络 - 3Blue1Brown (10)
-
但什么是神经网络?| 深度学习 第1章 - 3Blue1Brown - 中配
36:03
-
梯度下降:神经网络如何学习|深度学习 第2章 - 3Blue1Brown - 中配
40:38
-
反向传播,直观理解 | 深度学习 第3章 - 3Blue1Brown - 中配
24:58
-
反向传播的微积分|深度学习 第4章 - 3Blue1Brown - 中配
19:59
-
大语言模型简要解释 - 3Blue1Brown - 中配
15:42
-
Transformer:大语言模型背后的技术 | 深度学习 第5章 - 3Blue1Brown - 中配
53:37
-
Transformer中的注意力机制,一步步讲解 | 深度学习 第6章 - 3Blue1Brown - 中配
51:54
-
大语言模型可能是如何存储事实的 | 深度学习 第7章 - 3Blue1Brown - 中配
44:29
-
但交叉熵是什么?|压缩即智能 第2部分 - 3Blue1Brown - 中配
1:06:34
-
但AI图像和视频实际上是如何工作的?| Welch Labs 客座视频 - 3Blue1Brown - 中配
1:12:45
Parts
Description
3Blue1Brown《深度学习》第五章从线性回归讲到ChatGPT等大语言模型背后的Transformer:输入被切成token、映射成向量,经过注意力模块和前馈网络,用softmax输出下一个词的概率;并以GPT-3为例说明参数规模。预训练与微调、反复预测与采样、系统提示词,以及嵌入空间、上下文长度、温度参数等概念也串联起来,为下一章讲注意力做铺垫。 ---------------------------------------------------------------- 00:00:00 预测、采样、重复 00:02:56 Transformer内部 00:06:21 章节布局 00:07:03 深度学习的前提 00:12:04 词嵌入 00:17:46 词之外的嵌入 00:19:43 解嵌入 00:21:44 带温度的Softmax 00:25:13 接下来 ---------------------------------------------------------------- 原标题:Transformers, the tech behind LLMs | Deep Learning Chapter 5 原作者:3Blue1Brown 发布日期:2024-04-01 视频链接:https://www.youtube.com/watch?v=wjZofJX0v4M
Comments
出一期思维链吧?没看懂这个概率模型怎么会有思维链?
观看英文版请跳转至P2
强烈建议把语言向量运算那段做成短视频,-日本+寿司+德国=香肠,这例子绝了
词元背后的含义被嵌入到一万两千维的空间里,还能用坐标和方向来表示关系,而且跨主题都成立,这也太离谱了。就像日本→寿司和德国→香肠是类似的关系,真的绝了
希望这不是愚人节玩笑
无限猴子打字机