Transformer到底是个啥?一个动画彻底搞懂

合集 · AI大模型底层技术原理 (3)

  1. 10:37
    从一个猜水果的游戏,一步步搞懂神经网络
  2. 25:15
    从词向量到Transformer,AI大模型背后的原理,一个动画急速入门
  3. 24:16
    Transformer到底是个啥?一个动画彻底搞懂
Description
LLM系列图文教程:https://www.xuanyuancode.com/ai-llm
视频中的动画使用https://svganimate.ai 制作

Comments

yuioiuy- 15h ago

是变形金刚

♥ 66 ↩ 5

火神最拉胯 2h ago

我的天呐,一个科普视频,把attention读成啊塔西

♥ 1

这是一个修改了的昵称 10h ago

@MilkyAi @总结猫 总结后总结后私发给我

♥ 1 ↩ 2

enjoy七星 1d ago

太牛了,讲的很好。另外现在的大模型已经对原始的Transformer做了太多太多的改变了,就比如说DeepSeek今年就改了很多机制上的创新,这些看的时候也基本上看不懂

♥ 27 ↩ 6

雪莉獭祭 1d ago

讲的太好了,大学那会儿前沿还在大聊特聊LSTM,Transformer还是很新鲜的东西,后面毕业关注少了,正好来补补课

♥ 8 ↩ 1

水都桑 1h ago

还以为是介绍变形金刚的

♥ 1

AlanWaP 22h ago

话说,我们现在这个阶段,还能说llm等模型是炼丹吗?

♥ 3 ↩ 1

Pura70P 5m ago

关注了

饰品A 13h ago

更难得的是对前沿性的处理,没有死守原始架构的教条式复述,而是把 RoPE、GQA、RMSNorm、SwiGLU 这些已经成为工程默认配置的改动,连同 MLA 这类为压缩 KV cache、缓解长上下文推理时显存带宽瓶颈而生的机制,都纳入同一条演化主线来讲,甚至连张量并行、投机解码、量化这些偏推理侧的工程手段都能顺带点到,这种对生产环境的熟悉度,不像临时翻论文凑出来的语感,更像长期做推理优化、真实踩过吞吐和延迟坑的人才会有的

♥ 3 ↩ 1

icaca 2h ago

Autobots, transform and roll out!

♥ 1

你们都别抢我昵称 30m ago

up前馈神经网络应该是FNN吧

冷若冰银 23h ago

太棒了,目前全站就看到这套视频讲的很不错,比枯燥的底层计算高,但是比纯模块细,类似“俯瞰”的视角[打call]非常感谢[打call][打call]接下来老哥有兴趣开一个snn----ssm的章节吗[doge]我是研究改进snn的,在一路优化之后把自己的主线模型优化成ssm了[笑哭]很好理解,snn基本上就是带一个脉冲发放的rnn(似乎正是这个脉冲让人脑逆天的),但是bp对“发放-不发放”这种0-1事件无法处理,怎么着都会爆炸(超级容易爆,nan不知道多少次了,几十亿的数值,有零有整的[笑哭][笑哭]),那去掉发放,snn只剩下膜电位线性累加---用并行扫描跳过------这就是ssm[doge]本人正在改进我的模型(虽然和mamba3有些殊途同归),但是带着snn风格和从第一性原理出发,还是有大不同[doge][doge][doge]在5080上跑,权重做了offload,参数堆到1.5b,正在预训练

♥ 2

Andy丶水 12h ago

喏,这就叫专业!

♥ 1

抹茶星系 2h ago

@伊莎贝拉莫塞德

qgsm2019 1d ago

[打call][脱单doge]

♥ 1

王牌喵喵驾驶员 1d ago

这应该是这么多年来我看过讲得最生动的视频了[doge_金箍]

♥ 1

Ktiax 4h ago

哎,我记得这玩意,最初被做出来的初衷好像只是为了让机器翻译跑的更快,但没想到顺手砸成了AI时代的基石

♥ 1 ↩ 1

wakinma 2h ago

这个系列不错啊,从头开始去看~

考拉不会拉 12h ago

@Ai好记总结助手 帮我总结一下视频要点,整理成思维导图对照学习

YOYO博库 5h ago

这个讲的好,有的课上来就读源码直接看不下去了