什么是交叉熵?压缩即智能 第二部分

Description
https://www.youtube.com/watch?v=GlYgs6v2YfU
2002年一篇疯狂的论文,仅用通用压缩工具gzip就自动聚类语言、还原谱系树——没有语言模型,没有预训练,靠的竟是压缩文件大小的细微差异。这背后藏着什么秘密?本期视频带你回归基础,从交叉熵的本质讲起:一根柱子、一个概率分布,如何度量“意外程度”?为什么训练大语言模型的损失函数必须是对数?压缩和预测究竟有什么深层联系?我们还会直观拆解知识蒸馏与KL散度,最终给你一个震撼视角:训练巨型模型,本质上就是在做压缩。数学在眨眼,你看到了吗?

Comments

oooooonc 2026-07-19

我们组师兄利用语言之间的固有差异这个现象,做了一个多语言文本引导的视觉异常检测的工作,发了PAMI[doge]

♥ 46 ↩ 2

面对生活或充实焦虑 2026-07-22

交叉熵实际上就是对预期的误差,类比人脑相当于实际发生的事情和预期的差距有多大,差距越大越吃惊 缺乏经验的人总是大惊小怪,因为他们的预期总是错的离谱.领导总要装作镇定自若,惊慌失措意味着领导者是菜鸟,会打击士气.好的故事要意料之外,情理之中,前者意味着新鲜,后者意味着可以理解,同时具备两者意味着可以通过学习让人脑预测的更精确.

♥ 34

白娅hakua 2026-07-18

声音怎么这么像三蓝一棕?

♥ 26 ↩ 3

晓莫愁 2026-07-17

[打call]

♥ 6

伊江痕 2026-07-17

哟 更新了[笑哭]

♥ 6 ↩ 1

JK-b站版 2026-07-25

太流畅了,配音比去年好了不少[打call]

♥ 4 ↩ 1

海洋YX 2026-07-17

一直想找中文版

♥ 3 ↩ 1

叫我澄玖就好 2026-07-25

是不是可以說模型訓練近似於訓練集的一種特別壓縮方式[呲牙]

♥ 2

现代时序加中断 2026-07-18

动画好精美,好漂亮啊。这是用什么软件做的[喜欢]

♥ 2 ↩ 1

flamety 2026-07-21

KL散度和交叉熵啥区别,前者不对称?

♥ 1 ↩ 1

HiWuKong 2026-07-21

请教我怎么给视频配的原声?给个提示方向都可以。有工具更好

↩ 1

_StarSeeker 2026-07-19

up用什么工具做的,感觉这种视频很nice呀,比看双语版盯着字幕没时间思考好太多了

↩ 1

Ai好记 2026-07-24

📝总结一下:1. 2002年的一篇论文证明,仅用通用文件压缩技术(如Zip)就能发现语言间的谱系关系。其核心逻辑是:语言模式越相似,用一种语言的压缩器处理另一种语言文本的效率就越高。 2. 上述现象的数学基础是“交叉熵”。它衡量的是,使用为分布Q优化的编码方案,对来自分布P的数据进行编码所需的平均比特数。 3. 交叉熵有一个关键性质:当且仅当分布P与Q完全相同时,交叉熵取最小值,且该最小值等于P的熵。这意味着编码方案与数据分布匹配时,压缩效率最高。 4. 在现代语言模型训练中,交叉熵被用作核心的损失函数。模型通过最小化其预测的概率分布与真实数据分布之间的交叉熵来学习,从而提升预测准确性。 5. 选择交叉熵作为损失函数并非偶然。数学上可证明,若要使损失函数仅在模型预测与真实数据分布一致时才最小化,则必须使用负对数函数,这直接导出了交叉熵公式。 6. “知识蒸馏”技术利用交叉熵,让小模型学习大模型的完整概率分布预测,而非仅仅模仿最终答案。这能传递更丰富的信息,提升小模型性能。 7. 文稿揭示了语言模型训练的本质:通过最小化交叉熵,模型实际上是在学习一种高效的文本压缩方案。这深刻印证了“压缩即智能”的观点,即理解世界就是找到其内在的简洁规律。 关注我,然后@我,即可总结! 获取视频逐字稿和PPT就上Ai好记,aihaoji.com 使用【0sv4】邀请码注册可获得额外奖励哦

江峰居士 2026-07-20

一直感觉以前的 NLP 就是在找文本主题[doge]

厉飞衡 2026-07-17

@MioriaAI 总结视频

↩ 1