从零构建语言模型:后训练与RLVR| Lecture 16 | 斯坦福CS336 | Stanford Online
合集 · Stanford CS336 | 2026 (16)
-
从零构建语言模型|Stanford CS336 Spring 2026 Lecture 1:概览与分词 | Stanford Online
1:19:22
-
从零构建语言模型:Stanford CS336 Lecture 2 PyTorch (einops) | Stanford Online
1:17:25
-
从零构建语言模型 | CS336 斯坦福课程 Lecture 3:架构详解 | Stanford Online
1:29:14
-
从零构建语言模型:注意力机制的替代方案 Stanford CS336 Lecture 4 | Stanford Online
1:26:21
-
从零构建语言模型:GPU与TPU实战 | Stanford CS336 第5讲 | Stanford Online
1:18:39
-
从零构建语言模型:Kernels、Triton与XLA详解 Stanford CS336 Lecture 6 | Stanford Online
1:26:41
-
斯坦福CS336从零构建语言模型 | 2026春 | 第7讲:并行计算 | Stanford Online
1:21:03
-
从零构建语言模型 | Stanford CS336 第八讲:并行计算 | Stanford Online
1:20:11
-
从零构建语言模型:Scaling Laws | Lecture 9 | Stanford CS336 | Stanford Online
1:17:57
-
从零构建语言模型:Inference全解析 | Stanford CS336 Lecture 10 | Stanford Online
1:25:30
-
从零构建语言模型:缩放定律详解 | Stanford CS336 Lecture 11 | Stanford Online
1:17:04
-
斯坦福CS336:从零实现语言模型 | 第十二讲:模型评估 | Stanford Online
1:18:35
-
从零构建语言模型|斯坦福CS336第13讲:数据来源与数据集 | Stanford Online
1:22:02
-
从头构建大语言模型:Stanford CS336第14讲:数据过滤与去重 | Stanford Online
1:24:46
-
从零学语言模型:SFT/RLHF后训练详解 | Stanford CS336 Lecture 15 | Stanford Online
1:19:55
-
从零构建语言模型:后训练与RLVR| Lecture 16 | 斯坦福CS336 | Stanford Online
1:15:51
Description
来源:https://www.youtube.com/watch?v=dIFAi87Ws4E 原标题:Stanford CS336 Language Modeling from Scratch | Spring 2026 | Lecture 16: Post-Training - RLVR 频道:Stanford Online 发布时间:2026-05-27 内容简介: 本视频是斯坦福大学CS336“从零构建语言模型”课程(Spring 2026)的第16讲,主题为“后训练 - RLVR”。主讲人为计算机科学教授Percy Liang(兼统计学)和Tatsunori Hashimoto。本讲深入探讨语言模型在预训练后的关键环节——后训练阶段,重点聚焦于RLVR(Reinforcement Learning from Verifiable Reward)方法,涵盖其原理、实现策略以及在模型对齐与优化中的作用。课程官方网站及完整播放列表见视频描述。