但交叉熵是什么?|压缩即智能 第2部分 - 3Blue1Brown - 中配
合集 · 神经网络 - 3Blue1Brown (10)
-
但什么是神经网络?| 深度学习 第1章 - 3Blue1Brown - 中配
36:03
-
梯度下降:神经网络如何学习|深度学习 第2章 - 3Blue1Brown - 中配
40:38
-
反向传播,直观理解 | 深度学习 第3章 - 3Blue1Brown - 中配
24:58
-
反向传播的微积分|深度学习 第4章 - 3Blue1Brown - 中配
19:59
-
大语言模型简要解释 - 3Blue1Brown - 中配
15:42
-
Transformer:大语言模型背后的技术 | 深度学习 第5章 - 3Blue1Brown - 中配
53:37
-
Transformer中的注意力机制,一步步讲解 | 深度学习 第6章 - 3Blue1Brown - 中配
51:54
-
大语言模型可能是如何存储事实的 | 深度学习 第7章 - 3Blue1Brown - 中配
44:29
-
但交叉熵是什么?|压缩即智能 第2部分 - 3Blue1Brown - 中配
1:06:34
-
但AI图像和视频实际上是如何工作的?| Welch Labs 客座视频 - 3Blue1Brown - 中配
1:12:45
Parts
Description
本视频从用 gzip 压缩文档来还原语言谱系树讲起,引出交叉熵;指出大模型的下一个 token 预测,本质是压缩,而不只是预测。交叉熵作为损失函数衡量预测分布与真实数据的差距,并自然引出 KL 散度;最后以知识蒸馏说明大模型输出如何训练小模型。 ---------------------------------------------------------------- 00:00:00 语言树与压缩 00:02:56 回顾最优编码 00:05:05 定义交叉熵 00:07:56 直觉与示例 00:12:13 语言树的应用 00:14:01 预训练大语言模型 00:19:42 什么使该损失函数最优? 00:25:13 蒸馏 00:29:09 3b1b人才 00:30:31 KL散度 ---------------------------------------------------------------- 原标题:But what is cross-entropy? | Compression is Intelligence Part 2 原作者:3Blue1Brown 发布日期:2026-07-16 视频链接:https://www.youtube.com/watch?v=GlYgs6v2YfU
Comments
我从来没这么快过
♥ 3
就是个小细节,但我超喜欢27:39那里用国际象棋做比喻的选择:那是马格努斯·卡尔森在2021年世界冠军赛第6局对涅波姆尼亚奇的136步马拉松胜局,历史上最长的世界冠军赛对局,也是我个人觉得马格努斯下过的最好的棋之一
♥ 2
咦,3b1b在b站不是有官号吗?
♥ 1
好吧,我没有看懂
♥ 1
观看英文版请跳转至P2
信息论绝对是他最喜欢的主题
有第三部分吗