斯坦福CS336:从零实现语言模型 | 第十二讲:模型评估 | Stanford Online

合集 · Stanford CS336 | 2026 (16)

  1. 1:19:22
    从零构建语言模型|Stanford CS336 Spring 2026 Lecture 1:概览与分词 | Stanford Online
  2. 1:17:25
    从零构建语言模型:Stanford CS336 Lecture 2 PyTorch (einops) | Stanford Online
  3. 1:29:14
    从零构建语言模型 | CS336 斯坦福课程 Lecture 3:架构详解 | Stanford Online
  4. 1:26:21
    从零构建语言模型:注意力机制的替代方案 Stanford CS336 Lecture 4 | Stanford Online
  5. 1:18:39
    从零构建语言模型:GPU与TPU实战 | Stanford CS336 第5讲 | Stanford Online
  6. 1:26:41
    从零构建语言模型:Kernels、Triton与XLA详解 Stanford CS336 Lecture 6 | Stanford Online
  7. 1:21:03
    斯坦福CS336从零构建语言模型 | 2026春 | 第7讲:并行计算 | Stanford Online
  8. 1:20:11
    从零构建语言模型 | Stanford CS336 第八讲:并行计算 | Stanford Online
  9. 1:17:57
    从零构建语言模型:Scaling Laws | Lecture 9 | Stanford CS336 | Stanford Online
  10. 1:25:30
    从零构建语言模型:Inference全解析 | Stanford CS336 Lecture 10 | Stanford Online
  11. 1:17:04
    从零构建语言模型:缩放定律详解 | Stanford CS336 Lecture 11 | Stanford Online
  12. 1:18:35
    斯坦福CS336:从零实现语言模型 | 第十二讲:模型评估 | Stanford Online
  13. 1:22:02
    从零构建语言模型|斯坦福CS336第13讲:数据来源与数据集 | Stanford Online
  14. 1:24:46
    从头构建大语言模型:Stanford CS336第14讲:数据过滤与去重 | Stanford Online
  15. 1:19:55
    从零学语言模型:SFT/RLHF后训练详解 | Stanford CS336 Lecture 15 | Stanford Online
  16. 1:15:51
    从零构建语言模型:后训练与RLVR| Lecture 16 | 斯坦福CS336 | Stanford Online
Description
来源:https://www.youtube.com/watch?v=JpAxdTWQJxM
原标题:Stanford CS336 Language Modeling from Scratch | Spring 2026 | Lecture 12: Evaluation
频道:Stanford Online
发布时间:2026-05-19

内容简介:
本讲是斯坦福大学CS336课程“从零实现语言模型”的第十二讲,主题为“模型评估”。主讲人Percy Liang教授(计算机科学系教授,兼统计学系)与Tatsunori Hashimoto助理教授(计算机科学系)将深入探讨语言模型评估的核心概念与方法。内容涵盖评估指标的选择(如困惑度、BLEU、ROUGE等)、自动化评估与人工评估的权衡、基准数据集的使用,以及如何构建公平、鲁棒的评估流程以衡量模型真实能力。课程旨在帮助学习者理解评估在模型开发中的关键作用,并为后续课程中的模型优化与对比奠定基础。更多课程信息及课表请访问:https://cs336.stanford.edu/