2小时极速复现LLaMA3, 掌握LlaMA就等于掌握9成开源大模型!LLaMA3架构全解与代码复现!

Parts

  1. P1 · 01 LLaMA整体架构与Embeddings
  2. P2 · 02 RMSNorm均方根层归一化
  3. P3 · 03 极速版旋转位置编码讲解
  4. P4 · 04 LlaMA架构中的注意力机制
  5. P5 · 05 LlaMA架构的完整复现
  6. P6 · 06 直播特惠+新课上线!
  7. P7 · 07 大模型训练课!完整课程介绍!
Description
全套复现代码大公开,欢迎自取!基于所有的大模型都是基于LlaMA3的架构在运作、掌握LlaMA就等于掌握了90%的开源大模型架构!扒拉了LLaMA3的全套代码并且加入了一系列推理加速机制、对代码进行了更新和修改,允许设置从002B到2B的各类大小的开源大模型,代码欢迎自取!这套公开课节选自《大模型原理与训练实战》课程,完整版课为付费课程,感兴趣的小伙伴按照视频里的流程扫麻回复“秒杀”咨询课程详情吧,回复“菜菜”领取课件哦~

Comments

K__unK 2024-10-09

菜菜老师,麻烦问一下KV cache是否能用在训练过程中,之前一直以为只有在推理的时候才会使用KV cache[微笑][微笑]

♥ 2 ↩ 3

赋范课堂 2024-10-06

上课到凌晨,还能持续发视频,菜菜老师真的,我哭死[大哭]

♥ 2 ↩ 2

起一个没人起的名字 2024-11-01

纯属误导人啊,layerNorm不是对单个token的所有特征进行归一化?按照你的例子,那应该是正上面的其中一行,而不是正上面的一个面。我说了不算,gpt4o也是这样说的。

♥ 1 ↩ 1

木羽Cheney 2024-10-06

跟着菜菜老师学,自己训练大模型[脱单doge]

♥ 1 ↩ 4

菊安酱 2024-10-06

全网首个深度讲解LlaMA3架构的视频[打call]

♥ 1 ↩ 1

kubernetes云原生加油站 2026-06-28

跟着老师学llama,是不是就能自己训练玩玩了

菜菜TsaiTsai 2024-11-18

限量返场秒杀,全年最低! 《2024机器学习实战》(11月班)底价入手!0基础直通Kaggle顶赛、直达大厂算法工程师求职标准!报名即赠【求职加油包】+【授课老师亲自答疑】+【独家AI助教与自动编程服务】…… ✅【课程大纲及其他信息】保存下图,长按识别,茴复“秒杀”,获取完整课程大纲&抱名连接哦

菜菜TsaiTsai 2024-11-11

[星星眼]双11狂欢盛典!!《大模型原理与训练实战》底价入手!大模型原理+NLP原理+大模型训练+大模型实战系列………… ✅【课程大纲及其他信息】🌍长按识别保存下图,茴复“秒杀”,获取完整课程大纲&抱名连接哦

流年觞留恋 2024-11-08

和   作怎么联系

↩ 1

子木与山乔 2024-10-30

layernorm和batchsize没有关系吧?

↩ 1

温酒斩花雄 2024-10-11

0基础能学吗  就只会一点python。  对机器学习和深度学习都不懂

↩ 5

账号已注销 2024-10-09

🤖用的不多,来个宝子一起拼。

心上炼世上磨 2024-10-06

一张4090能训练吗

↩ 1

账号已注销 2024-10-07

🤖PT4拿来写论文啥的挺方便,就是有点贵,来个宝子一起