大语言模型可能是如何存储事实的 | 深度学习 第7章 - 3Blue1Brown - 中配
合集 · 神经网络 - 3Blue1Brown (10)
-
但什么是神经网络?| 深度学习 第1章 - 3Blue1Brown - 中配
36:03
-
梯度下降:神经网络如何学习|深度学习 第2章 - 3Blue1Brown - 中配
40:38
-
反向传播,直观理解 | 深度学习 第3章 - 3Blue1Brown - 中配
24:58
-
反向传播的微积分|深度学习 第4章 - 3Blue1Brown - 中配
19:59
-
大语言模型简要解释 - 3Blue1Brown - 中配
15:42
-
Transformer:大语言模型背后的技术 | 深度学习 第5章 - 3Blue1Brown - 中配
53:37
-
Transformer中的注意力机制,一步步讲解 | 深度学习 第6章 - 3Blue1Brown - 中配
51:54
-
大语言模型可能是如何存储事实的 | 深度学习 第7章 - 3Blue1Brown - 中配
44:29
-
但交叉熵是什么?|压缩即智能 第2部分 - 3Blue1Brown - 中配
1:06:34
-
但AI图像和视频实际上是如何工作的?| Welch Labs 客座视频 - 3Blue1Brown - 中配
1:12:45
Parts
Description
3Blue1Brown《深度学习》第7章讲解大语言模型如何存储事实。以“迈克尔·乔丹打篮球”为例,拆解Transformer中MLP:嵌入向量经上投影、偏置、ReLU、下投影,把“篮球”方向写进结果。视频用高维空间近垂直方向解释“叠加”假说,说明神经元未必对应单一特征,并引入稀疏自编码器提取特征;还量化了GPT-3的MLP参数规模,最后预告下一章讲训练与规模定律。 ---------------------------------------------------------------- 00:00:00 LLM中事实的存储位置 00:02:13 Transformer快速回顾 00:04:25 玩具示例的假设 00:05:47 多层感知机内部 00:15:00 参数计数 00:16:23 叠加 00:20:43 接下来 ---------------------------------------------------------------- 原标题:How might LLMs store facts | Deep Learning Chapter 7 原作者:3Blue1Brown 发布日期:2024-08-31 视频链接:https://www.youtube.com/watch?v=9-Jl0dxWQs8
Comments
看视频的时候我一直在想:“但它能编码的‘概念’数量应该受限于嵌入向量的维度吧,那‘篮球’或‘迈克尔’这种词怎么会这么具体?”直到你讲了叠加态,一切都通了,现在合理多了!
♥ 3
站内搬运是吧?
还在等第8集,别忘了啊,训练部分才是最重要的!!(:
↩ 1
近乎垂直的嵌入也太离谱了,让我想起十维空间里的球。
观看英文版请跳转至P2
第二[打call]
第一,长脑子。