大语言模型如何读图? - Graduate ML - 英语原声/中配

Parts

  1. P1 · 配音
  2. P2 · 原声
Description
P1中文配音 / P2英语原声
----------------------------------------------------------------
本视频讲解大语言模型如何“读图”:把图像切成图块并打乱,再加入空白类别 token,通过注意力机制让图块之间彼此“聆听”。内容拆解查询、键、值、Softmax 加权混合,并说明位置编码如何补上位置信息,使邻域猜测从限制变成提示。最后延伸到 CLIP 架构,用额外簿记稳定梯度下降,核心是让导数来决定谁和谁对话。
----------------------------------------------------------------
00:00:00 窗口的局限
00:02:14 引入注意力机制
00:03:13 注意力的运作机制
00:06:18 类别标记与训练
00:08:02 应对设计挑战
00:10:01 Transformer与未来
----------------------------------------------------------------
原标题:How Do Large Language Models Read Pictures?
原作者:Graduate ML
发布日期:2026-09-22
视频链接:https://www.youtube.com/watch?v=pfJtaw_OSsk

Comments

旁白_B 1d ago

“像我们平时那样走下坡路”——确实

♥ 1 ↩ 1

旁白_B 1d ago

我现在就要赌气搞一个墨镜长颈鹿检测器

我不是鲲宝 1d ago

识别的速度多快