从零构建语言模型:后训练与RLVR| Lecture 16 | 斯坦福CS336 | Stanford Online

合集 · Stanford CS336 | 2026 (16)

  1. 1:19:22
    从零构建语言模型|Stanford CS336 Spring 2026 Lecture 1:概览与分词 | Stanford Online
  2. 1:17:25
    从零构建语言模型:Stanford CS336 Lecture 2 PyTorch (einops) | Stanford Online
  3. 1:29:14
    从零构建语言模型 | CS336 斯坦福课程 Lecture 3:架构详解 | Stanford Online
  4. 1:26:21
    从零构建语言模型:注意力机制的替代方案 Stanford CS336 Lecture 4 | Stanford Online
  5. 1:18:39
    从零构建语言模型:GPU与TPU实战 | Stanford CS336 第5讲 | Stanford Online
  6. 1:26:41
    从零构建语言模型:Kernels、Triton与XLA详解 Stanford CS336 Lecture 6 | Stanford Online
  7. 1:21:03
    斯坦福CS336从零构建语言模型 | 2026春 | 第7讲:并行计算 | Stanford Online
  8. 1:20:11
    从零构建语言模型 | Stanford CS336 第八讲:并行计算 | Stanford Online
  9. 1:17:57
    从零构建语言模型:Scaling Laws | Lecture 9 | Stanford CS336 | Stanford Online
  10. 1:25:30
    从零构建语言模型:Inference全解析 | Stanford CS336 Lecture 10 | Stanford Online
  11. 1:17:04
    从零构建语言模型:缩放定律详解 | Stanford CS336 Lecture 11 | Stanford Online
  12. 1:18:35
    斯坦福CS336:从零实现语言模型 | 第十二讲:模型评估 | Stanford Online
  13. 1:22:02
    从零构建语言模型|斯坦福CS336第13讲:数据来源与数据集 | Stanford Online
  14. 1:24:46
    从头构建大语言模型:Stanford CS336第14讲:数据过滤与去重 | Stanford Online
  15. 1:19:55
    从零学语言模型:SFT/RLHF后训练详解 | Stanford CS336 Lecture 15 | Stanford Online
  16. 1:15:51
    从零构建语言模型:后训练与RLVR| Lecture 16 | 斯坦福CS336 | Stanford Online
Description
来源:https://www.youtube.com/watch?v=dIFAi87Ws4E
原标题:Stanford CS336 Language Modeling from Scratch | Spring 2026 | Lecture 16: Post-Training - RLVR
频道:Stanford Online
发布时间:2026-05-27

内容简介:
本视频是斯坦福大学CS336“从零构建语言模型”课程(Spring 2026)的第16讲,主题为“后训练 - RLVR”。主讲人为计算机科学教授Percy Liang(兼统计学)和Tatsunori Hashimoto。本讲深入探讨语言模型在预训练后的关键环节——后训练阶段,重点聚焦于RLVR(Reinforcement Learning from Verifiable Reward)方法,涵盖其原理、实现策略以及在模型对齐与优化中的作用。课程官方网站及完整播放列表见视频描述。