【全网最强】DeepSeek R1论文逐段精读与训练流程代码复现|R1强化学习训练流程详解、模型蒸馏方法介绍|GRPO原理介绍与代码复现
合集 · DeepSeek干货实战教程 (17)
-
DeepSeek v3本地部署与调用实战|vLLM、SGLang、LMDeploy+DeepSeek v3部署调用实战
33:40
-
DeepSeek-v3调用指南与Function calling技术实战|DeepSeek v3模型参数详解与Tool Use功能实战
1:37:25
-
手动复现DeepSeek v3!从零训练Mini DeepSeek v3!模型预训练+全量指令微调+DPO强化学习微调全流程实战
2:00:14
-
DeepSeek v3搭建Multi-Agent技术入门实战|DeepSeek v3+OpenAI Swarm技术实战
1:00:04
-
DeepSeek v3+GraphRAG技术实战|DeepSeek v3知识图谱检索增强技术实战
44:01
-
DeepSeek R1本地部署与调用指南|transformer、Ollama、vLLM、LMDeploy、SGLang部署与调用R1与蒸馏模型组
54:58
-
DeepSeek R1 API调用实战!DeepSeek R1模型参数详解与模型功能介绍|自动编程、自动机器学习项目入门实战
23:52
-
借助DeepSeek R1进行模型蒸馏,模型蒸馏入门实战!从零训练DeepSeek R1 Distill模型|模型蒸馏技术实战
1:19:22
-
DeepSeek R1搭建本地知识库问答系统|DeepSeek+Ollama+RAG本地知识库问答实战|AnythingLLM快速部署与应用实战
47:16
-
DeepSeek Janus Pro重磅开源!文生图+图像识别,统一多模态大模型奠基之作!超越DALL-E 3、SD3 Medium
25:10
-
DeepSeek Janus Pro本地部署与调用实战!图像识别+文生图统一多模态大模型本地部署与调用流程详解!
34:13
-
【全网独家】训练定制化DeepSeek R1!零基础DeepSeek R1高效微调实战|知识灌注+对话风格微调,推理模型+Cot数据集微调实战!
1:51:26
-
【全网最强】DeepSeek R1论文逐段精读与训练流程代码复现|R1强化学习训练流程详解、模型蒸馏方法介绍|GRPO原理介绍与代码复现
2:42:26
-
联网+本地知识问答+外部工具调用+代码解释器+多用户并发+多模型切换,DeepSeek+Open-WebUI终极部署指南!
1:49:52
-
最低0显存,独家Unsloth动态量化部署满血DeepSeek|纯CPU推理、CPU+GPU混合推理、纯GPU推理方案详解|企业级最佳部署方案
1:43:00
-
【全网独家】训练定制化DeepSeek R1!零基础DeepSeek R1高效微调实战|知识灌注+对话风格微调,推理模型+Cot数据集微调实战!
1:50:46
-
独家KTransformers技术实战,手把手跑通4090运行DeepSeek满血版,独家FastAPI脚本编写&Open-WebUI结合方案深度讲解
1:53:14
Parts
- P1 · 1.DeepSeek R1论文精读与复现
- P2 · 2.DeepSeek R1模型综述与全球复现项目介绍
- P3 · 3.DeepSeek R1论文核心内容与基本结构介绍
- P4 · 4.论文摘要与实验贡献部分解读
- P5 · 5.论文R1 Zero模型训练过程解读
- P6 · 6.GRPO强化学习算法原理介绍
- P7 · 7.论文R1模型训练流程详解(上)
- P8 · 8.论文R1训练流程解读(下)
- P9 · 9.论文模型蒸馏流程详解
- P10 · 10.R1模型训练复盘与未来展望
- P11 · 11.R1论文完整内容梳理
- P12 · 12.热门GRPO训练工具介绍
- P13 · 13.GRPO强化学习训练软硬件环境准备
- P14 · 14.GRPO强化学习奖励函数组编写
- P15 · 15.DeepSeek R1 GRPO强化学习训练流程
Description
全网最强DeepSeek R1论文逐段精读与训练流程代码复现教程来啦!宝藏级论文通篇精读,详解R1 Zero训练流程详解+R1四阶段训练方法论+GRPO强化学习原理+R1模型蒸馏流程,更有代码复现完整R1强化学习训练流程实操实验! ✅置顶评论扫码加入【赋范大模型技术社区】,领【本视频完整课件】,以及更多【海量硬核独家技术干货】内容+无门槛技术交流,期待你的加入!
Comments
看完了,少有的在真正讲代码的博主,B站清流啊
♥ 7 ↩ 1
10 未来研究方向部分讲得不对吧,论文说的是few-shot会降低性能,建议直接zero-shot。视频里讲反了
♥ 5
这不比组会强多了,看完顶我10次组会!
♥ 3 ↩ 1
这里其实有一个问题,原论文写的是第三阶段在v3-base的基础上(而不是v3-base+code_start+1st RL)进行训练的,所以那个图从r1 v2.0指向 v3.0是不是有歧义?
♥ 3 ↩ 3
大佬就是大佬
♥ 3 ↩ 2
火钳刘明
♥ 3 ↩ 1
打卡
♥ 1
完整课程去哪里报名参加?
♥ 1 ↩ 1
想问下这里的训练过程中哪里有涉及到reference model和group computation?似乎只有reward model?
♥ 1 ↩ 1
讲得真好, 懂了, 赞👍
♥ 1 ↩ 1
感谢分享,讲的很精彩
♥ 1 ↩ 2
UP牛逼,UP威武
♥ 1 ↩ 1
求一个课件ppt,扫二维码后分享的资料只有jupyter实战代码,没有课件ppt
♥ 1 ↩ 4
我想问一下,在训练过程中总是先思考再回答。但是在使用的时候思考模式是可选的,如果选择不思考的话,不是和训练过程不一致吗,理论上回答的效果应该很差(因为训练的时候没有见过不思考的情形)。但是实际使用的时候回答的效果还是很好,这是怎么做到的呢。
♥ 1 ↩ 1
一如既往的优质干货
♥ 1 ↩ 1
加了老师的微信,没看到讲的课件呢?
♥ 1 ↩ 4
我想请教一下,SFT有监督跨域学习会产生遗忘。强化学习第一阶段是准确性奖励,第三阶段强化学习是无害性,会不会跟有监督学习一样遗忘/丢失第一阶段对于问题的准确性呢?
grpoconfig里面并没有vllm的参数
论文原文要是有中文版就完美了,更方便中国人学习