enjoy七星 1d ago 太牛了,讲的很好。另外现在的大模型已经对原始的Transformer做了太多太多的改变了,就比如说DeepSeek今年就改了很多机制上的创新,这些看的时候也基本上看不懂 ♥ 27 ↩ 6
饰品A 13h ago 更难得的是对前沿性的处理,没有死守原始架构的教条式复述,而是把 RoPE、GQA、RMSNorm、SwiGLU 这些已经成为工程默认配置的改动,连同 MLA 这类为压缩 KV cache、缓解长上下文推理时显存带宽瓶颈而生的机制,都纳入同一条演化主线来讲,甚至连张量并行、投机解码、量化这些偏推理侧的工程手段都能顺带点到,这种对生产环境的熟悉度,不像临时翻论文凑出来的语感,更像长期做推理优化、真实踩过吞吐和延迟坑的人才会有的 ♥ 3 ↩ 1
冷若冰银 23h ago 太棒了,目前全站就看到这套视频讲的很不错,比枯燥的底层计算高,但是比纯模块细,类似“俯瞰”的视角[打call]非常感谢[打call][打call]接下来老哥有兴趣开一个snn----ssm的章节吗[doge]我是研究改进snn的,在一路优化之后把自己的主线模型优化成ssm了[笑哭]很好理解,snn基本上就是带一个脉冲发放的rnn(似乎正是这个脉冲让人脑逆天的),但是bp对“发放-不发放”这种0-1事件无法处理,怎么着都会爆炸(超级容易爆,nan不知道多少次了,几十亿的数值,有零有整的[笑哭][笑哭]),那去掉发放,snn只剩下膜电位线性累加---用并行扫描跳过------这就是ssm[doge]本人正在改进我的模型(虽然和mamba3有些殊途同归),但是带着snn风格和从第一性原理出发,还是有大不同[doge][doge][doge]在5080上跑,权重做了offload,参数堆到1.5b,正在预训练 ♥ 2
Comments
是变形金刚
♥ 66 ↩ 5
我的天呐,一个科普视频,把attention读成啊塔西
♥ 1
@MilkyAi @总结猫 总结后总结后私发给我
♥ 1 ↩ 2
太牛了,讲的很好。另外现在的大模型已经对原始的Transformer做了太多太多的改变了,就比如说DeepSeek今年就改了很多机制上的创新,这些看的时候也基本上看不懂
♥ 27 ↩ 6
讲的太好了,大学那会儿前沿还在大聊特聊LSTM,Transformer还是很新鲜的东西,后面毕业关注少了,正好来补补课
♥ 8 ↩ 1
还以为是介绍变形金刚的
♥ 1
话说,我们现在这个阶段,还能说llm等模型是炼丹吗?
♥ 3 ↩ 1
关注了
更难得的是对前沿性的处理,没有死守原始架构的教条式复述,而是把 RoPE、GQA、RMSNorm、SwiGLU 这些已经成为工程默认配置的改动,连同 MLA 这类为压缩 KV cache、缓解长上下文推理时显存带宽瓶颈而生的机制,都纳入同一条演化主线来讲,甚至连张量并行、投机解码、量化这些偏推理侧的工程手段都能顺带点到,这种对生产环境的熟悉度,不像临时翻论文凑出来的语感,更像长期做推理优化、真实踩过吞吐和延迟坑的人才会有的
♥ 3 ↩ 1
Autobots, transform and roll out!
♥ 1
up前馈神经网络应该是FNN吧
太棒了,目前全站就看到这套视频讲的很不错,比枯燥的底层计算高,但是比纯模块细,类似“俯瞰”的视角[打call]非常感谢[打call][打call]接下来老哥有兴趣开一个snn----ssm的章节吗[doge]我是研究改进snn的,在一路优化之后把自己的主线模型优化成ssm了[笑哭]很好理解,snn基本上就是带一个脉冲发放的rnn(似乎正是这个脉冲让人脑逆天的),但是bp对“发放-不发放”这种0-1事件无法处理,怎么着都会爆炸(超级容易爆,nan不知道多少次了,几十亿的数值,有零有整的[笑哭][笑哭]),那去掉发放,snn只剩下膜电位线性累加---用并行扫描跳过------这就是ssm[doge]本人正在改进我的模型(虽然和mamba3有些殊途同归),但是带着snn风格和从第一性原理出发,还是有大不同[doge][doge][doge]在5080上跑,权重做了offload,参数堆到1.5b,正在预训练
♥ 2
喏,这就叫专业!
♥ 1
@伊莎贝拉莫塞德
[打call][脱单doge]
♥ 1
这应该是这么多年来我看过讲得最生动的视频了[doge_金箍]
♥ 1
哎,我记得这玩意,最初被做出来的初衷好像只是为了让机器翻译跑的更快,但没想到顺手砸成了AI时代的基石
♥ 1 ↩ 1
这个系列不错啊,从头开始去看~
@Ai好记总结助手 帮我总结一下视频要点,整理成思维导图对照学习
这个讲的好,有的课上来就读源码直接看不下去了