大语言模型简要解释 - 3Blue1Brown - 中配
合集 · 神经网络 - 3Blue1Brown (10)
-
但什么是神经网络?| 深度学习 第1章 - 3Blue1Brown - 中配
36:03
-
梯度下降:神经网络如何学习|深度学习 第2章 - 3Blue1Brown - 中配
40:38
-
反向传播,直观理解 | 深度学习 第3章 - 3Blue1Brown - 中配
24:58
-
反向传播的微积分|深度学习 第4章 - 3Blue1Brown - 中配
19:59
-
大语言模型简要解释 - 3Blue1Brown - 中配
15:42
-
Transformer:大语言模型背后的技术 | 深度学习 第5章 - 3Blue1Brown - 中配
53:37
-
Transformer中的注意力机制,一步步讲解 | 深度学习 第6章 - 3Blue1Brown - 中配
51:54
-
大语言模型可能是如何存储事实的 | 深度学习 第7章 - 3Blue1Brown - 中配
44:29
-
但交叉熵是什么?|压缩即智能 第2部分 - 3Blue1Brown - 中配
1:06:34
-
但AI图像和视频实际上是如何工作的?| Welch Labs 客座视频 - 3Blue1Brown - 中配
1:12:45
Parts
Description
3Blue1Brown简要解释大语言模型:它本质是根据提示预测下一个词的函数,靠“自动补全”生成回答。核心是Transformer架构的注意力机制,经预训练与人类反馈强化学习优化。强大能力源于涌现现象,训练依赖GPU并行计算。若想深入,作者还有更多干货可讲。 ---------------------------------------------------------------- 原标题:Large Language Models explained briefly 原作者:3Blue1Brown 发布日期:2024-11-20 视频链接:https://www.youtube.com/watch?v=LPZh9BOjkQs
Comments
观看英文版请跳转至P2
3B1B给CHM讲解带RLHF的大语言模型!
所以如果有足够多的人发布“地球是平的”这类输入材料,就能把模型的概率带偏?
↩ 2
这应该是看其他所有解释视频之前先看的第一支视频,打基础太合适了。