【全网最强】DeepSeek R1论文逐段精读与训练流程代码复现|R1强化学习训练流程详解、模型蒸馏方法介绍|GRPO原理介绍与代码复现

合集 · DeepSeek干货实战教程 (17)

  1. 33:40
    DeepSeek v3本地部署与调用实战|vLLM、SGLang、LMDeploy+DeepSeek v3部署调用实战
  2. 1:37:25
    DeepSeek-v3调用指南与Function calling技术实战|DeepSeek v3模型参数详解与Tool Use功能实战
  3. 2:00:14
    手动复现DeepSeek v3!从零训练Mini DeepSeek v3!模型预训练+全量指令微调+DPO强化学习微调全流程实战
  4. 1:00:04
    DeepSeek v3搭建Multi-Agent技术入门实战|DeepSeek v3+OpenAI Swarm技术实战
  5. 44:01
    DeepSeek v3+GraphRAG技术实战|DeepSeek v3知识图谱检索增强技术实战
  6. 54:58
    DeepSeek R1本地部署与调用指南|transformer、Ollama、vLLM、LMDeploy、SGLang部署与调用R1与蒸馏模型组
  7. 23:52
    DeepSeek R1 API调用实战!DeepSeek R1模型参数详解与模型功能介绍|自动编程、自动机器学习项目入门实战
  8. 1:19:22
    借助DeepSeek R1进行模型蒸馏,模型蒸馏入门实战!从零训练DeepSeek R1 Distill模型|模型蒸馏技术实战
  9. 47:16
    DeepSeek R1搭建本地知识库问答系统|DeepSeek+Ollama+RAG本地知识库问答实战|AnythingLLM快速部署与应用实战
  10. 25:10
    DeepSeek Janus Pro重磅开源!文生图+图像识别,统一多模态大模型奠基之作!超越DALL-E 3、SD3 Medium
  11. 34:13
    DeepSeek Janus Pro本地部署与调用实战!图像识别+文生图统一多模态大模型本地部署与调用流程详解!
  12. 1:51:26
    【全网独家】训练定制化DeepSeek R1!零基础DeepSeek R1高效微调实战|知识灌注+对话风格微调,推理模型+Cot数据集微调实战!
  13. 2:42:26
    【全网最强】DeepSeek R1论文逐段精读与训练流程代码复现|R1强化学习训练流程详解、模型蒸馏方法介绍|GRPO原理介绍与代码复现
  14. 1:49:52
    联网+本地知识问答+外部工具调用+代码解释器+多用户并发+多模型切换,DeepSeek+Open-WebUI终极部署指南!
  15. 1:43:00
    最低0显存,独家Unsloth动态量化部署满血DeepSeek|纯CPU推理、CPU+GPU混合推理、纯GPU推理方案详解|企业级最佳部署方案
  16. 1:50:46
    【全网独家】训练定制化DeepSeek R1!零基础DeepSeek R1高效微调实战|知识灌注+对话风格微调,推理模型+Cot数据集微调实战!
  17. 1:53:14
    独家KTransformers技术实战,手把手跑通4090运行DeepSeek满血版,独家FastAPI脚本编写&Open-WebUI结合方案深度讲解

Parts

  1. P1 · 1.DeepSeek R1论文精读与复现
  2. P2 · 2.DeepSeek R1模型综述与全球复现项目介绍
  3. P3 · 3.DeepSeek R1论文核心内容与基本结构介绍
  4. P4 · 4.论文摘要与实验贡献部分解读
  5. P5 · 5.论文R1 Zero模型训练过程解读
  6. P6 · 6.GRPO强化学习算法原理介绍
  7. P7 · 7.论文R1模型训练流程详解(上)
  8. P8 · 8.论文R1训练流程解读(下)
  9. P9 · 9.论文模型蒸馏流程详解
  10. P10 · 10.R1模型训练复盘与未来展望
  11. P11 · 11.R1论文完整内容梳理
  12. P12 · 12.热门GRPO训练工具介绍
  13. P13 · 13.GRPO强化学习训练软硬件环境准备
  14. P14 · 14.GRPO强化学习奖励函数组编写
  15. P15 · 15.DeepSeek R1 GRPO强化学习训练流程
Description
全网最强DeepSeek R1论文逐段精读与训练流程代码复现教程来啦!宝藏级论文通篇精读,详解R1 Zero训练流程详解+R1四阶段训练方法论+GRPO强化学习原理+R1模型蒸馏流程,更有代码复现完整R1强化学习训练流程实操实验!
✅置顶评论扫码加入【赋范大模型技术社区】,领【本视频完整课件】,以及更多【海量硬核独家技术干货】内容+无门槛技术交流,期待你的加入!

Comments

星河梦鈺 2025-02-18

看完了,少有的在真正讲代码的博主,B站清流啊

♥ 7 ↩ 1

贪恋而冬瓜16 2025-02-23

10 未来研究方向部分讲得不对吧,论文说的是few-shot会降低性能,建议直接zero-shot。视频里讲反了

♥ 5

壹字之师 2025-02-18

这不比组会强多了,看完顶我10次组会!

♥ 3 ↩ 1

布衣南山 2025-02-17

这里其实有一个问题,原论文写的是第三阶段在v3-base的基础上(而不是v3-base+code_start+1st RL)进行训练的,所以那个图从r1 v2.0指向 v3.0是不是有歧义?

♥ 3 ↩ 3

lalaksjdhfg 2025-02-14

大佬就是大佬

♥ 3 ↩ 2

Vampire丶誓言 2025-02-13

火钳刘明

♥ 3 ↩ 1

狗子丞相 2025-02-28

打卡

♥ 1

请过好这一生 2025-02-26

完整课程去哪里报名参加?

♥ 1 ↩ 1

LegendaryStudios 2025-02-25

想问下这里的训练过程中哪里有涉及到reference model和group computation?似乎只有reward model?

♥ 1 ↩ 1

六六六子合 2025-02-24

讲得真好, 懂了, 赞👍

♥ 1 ↩ 1

退六腑 2025-02-21

感谢分享,讲的很精彩

♥ 1 ↩ 2

自纠缠潜能动力学 2025-03-01

UP牛逼,UP威武

♥ 1 ↩ 1

Vaciness 2025-02-19

求一个课件ppt,扫二维码后分享的资料只有jupyter实战代码,没有课件ppt

♥ 1 ↩ 4

无法原谅我的帅 2025-02-16

我想问一下,在训练过程中总是先思考再回答。但是在使用的时候思考模式是可选的,如果选择不思考的话,不是和训练过程不一致吗,理论上回答的效果应该很差(因为训练的时候没有见过不思考的情形)。但是实际使用的时候回答的效果还是很好,这是怎么做到的呢。

♥ 1 ↩ 1

雪中梅兰 2025-02-18

一如既往的优质干货

♥ 1 ↩ 1

wannana131 2025-02-15

加了老师的微信,没看到讲的课件呢?

♥ 1 ↩ 4

北海星辰_ 2025-06-28

我想请教一下,SFT有监督跨域学习会产生遗忘。强化学习第一阶段是准确性奖励,第三阶段强化学习是无害性,会不会跟有监督学习一样遗忘/丢失第一阶段对于问题的准确性呢?

南江才子 2025-06-04

grpoconfig里面并没有vllm的参数

s1g2k3 2025-03-02

论文原文要是有中文版就完美了,更方便中国人学习