大语言模型可能是如何存储事实的 | 深度学习 第7章 - 3Blue1Brown - 中配

合集 · 神经网络 - 3Blue1Brown (10)

  1. 36:03
    但什么是神经网络?| 深度学习 第1章 - 3Blue1Brown - 中配
  2. 40:38
    梯度下降:神经网络如何学习|深度学习 第2章 - 3Blue1Brown - 中配
  3. 24:58
    反向传播,直观理解 | 深度学习 第3章 - 3Blue1Brown - 中配
  4. 19:59
    反向传播的微积分|深度学习 第4章 - 3Blue1Brown - 中配
  5. 15:42
    大语言模型简要解释 - 3Blue1Brown - 中配
  6. 53:37
    Transformer:大语言模型背后的技术 | 深度学习 第5章 - 3Blue1Brown - 中配
  7. 51:54
    Transformer中的注意力机制,一步步讲解 | 深度学习 第6章 - 3Blue1Brown - 中配
  8. 44:29
    大语言模型可能是如何存储事实的 | 深度学习 第7章 - 3Blue1Brown - 中配
  9. 1:06:34
    但交叉熵是什么?|压缩即智能 第2部分 - 3Blue1Brown - 中配
  10. 1:12:45
    但AI图像和视频实际上是如何工作的?| Welch Labs 客座视频 - 3Blue1Brown - 中配

Parts

  1. P1 · 配音
  2. P2 · 原声
Description
3Blue1Brown《深度学习》第7章讲解大语言模型如何存储事实。以“迈克尔·乔丹打篮球”为例,拆解Transformer中MLP:嵌入向量经上投影、偏置、ReLU、下投影,把“篮球”方向写进结果。视频用高维空间近垂直方向解释“叠加”假说,说明神经元未必对应单一特征,并引入稀疏自编码器提取特征;还量化了GPT-3的MLP参数规模,最后预告下一章讲训练与规模定律。
----------------------------------------------------------------
00:00:00 LLM中事实的存储位置
00:02:13 Transformer快速回顾
00:04:25 玩具示例的假设
00:05:47 多层感知机内部
00:15:00 参数计数
00:16:23 叠加
00:20:43 接下来
----------------------------------------------------------------
原标题:How might LLMs store facts | Deep Learning Chapter 7
原作者:3Blue1Brown
发布日期:2024-08-31
视频链接:https://www.youtube.com/watch?v=9-Jl0dxWQs8

Comments

旁白_B 26d ago

看视频的时候我一直在想:“但它能编码的‘概念’数量应该受限于嵌入向量的维度吧,那‘篮球’或‘迈克尔’这种词怎么会这么具体?”直到你讲了叠加态,一切都通了,现在合理多了!

♥ 3

通职者Ratel 2d ago

站内搬运是吧?

旁白_B 26d ago

还在等第8集,别忘了啊,训练部分才是最重要的!!(:

↩ 1

旁白_B 26d ago

近乎垂直的嵌入也太离谱了,让我想起十维空间里的球。

给你机会你不中用吗 22d ago

观看英文版请跳转至P2

-将久- 26d ago

第二[打call]

bili_81101293588 26d ago

第一,长脑子。