2小时极速复现LLaMA3, 掌握LlaMA就等于掌握9成开源大模型!LLaMA3架构全解与代码复现!
Parts
Description
全套复现代码大公开,欢迎自取!基于所有的大模型都是基于LlaMA3的架构在运作、掌握LlaMA就等于掌握了90%的开源大模型架构!扒拉了LLaMA3的全套代码并且加入了一系列推理加速机制、对代码进行了更新和修改,允许设置从002B到2B的各类大小的开源大模型,代码欢迎自取!这套公开课节选自《大模型原理与训练实战》课程,完整版课为付费课程,感兴趣的小伙伴按照视频里的流程扫麻回复“秒杀”咨询课程详情吧,回复“菜菜”领取课件哦~
Comments
菜菜老师,麻烦问一下KV cache是否能用在训练过程中,之前一直以为只有在推理的时候才会使用KV cache[微笑][微笑]
♥ 2 ↩ 3
上课到凌晨,还能持续发视频,菜菜老师真的,我哭死[大哭]
♥ 2 ↩ 2
纯属误导人啊,layerNorm不是对单个token的所有特征进行归一化?按照你的例子,那应该是正上面的其中一行,而不是正上面的一个面。我说了不算,gpt4o也是这样说的。
♥ 1 ↩ 1
跟着菜菜老师学,自己训练大模型[脱单doge]
♥ 1 ↩ 4
全网首个深度讲解LlaMA3架构的视频[打call]
♥ 1 ↩ 1
跟着老师学llama,是不是就能自己训练玩玩了
限量返场秒杀,全年最低! 《2024机器学习实战》(11月班)底价入手!0基础直通Kaggle顶赛、直达大厂算法工程师求职标准!报名即赠【求职加油包】+【授课老师亲自答疑】+【独家AI助教与自动编程服务】…… ✅【课程大纲及其他信息】保存下图,长按识别,茴复“秒杀”,获取完整课程大纲&抱名连接哦
[星星眼]双11狂欢盛典!!《大模型原理与训练实战》底价入手!大模型原理+NLP原理+大模型训练+大模型实战系列………… ✅【课程大纲及其他信息】🌍长按识别保存下图,茴复“秒杀”,获取完整课程大纲&抱名连接哦
和 作怎么联系
↩ 1
layernorm和batchsize没有关系吧?
↩ 1
0基础能学吗 就只会一点python。 对机器学习和深度学习都不懂
↩ 5
🤖用的不多,来个宝子一起拼。
一张4090能训练吗
↩ 1
🤖PT4拿来写论文啥的挺方便,就是有点贵,来个宝子一起