斯坦福CS336:从零实现语言模型 | 第十二讲:模型评估 | Stanford Online
合集 · Stanford CS336 | 2026 (16)
-
从零构建语言模型|Stanford CS336 Spring 2026 Lecture 1:概览与分词 | Stanford Online
1:19:22
-
从零构建语言模型:Stanford CS336 Lecture 2 PyTorch (einops) | Stanford Online
1:17:25
-
从零构建语言模型 | CS336 斯坦福课程 Lecture 3:架构详解 | Stanford Online
1:29:14
-
从零构建语言模型:注意力机制的替代方案 Stanford CS336 Lecture 4 | Stanford Online
1:26:21
-
从零构建语言模型:GPU与TPU实战 | Stanford CS336 第5讲 | Stanford Online
1:18:39
-
从零构建语言模型:Kernels、Triton与XLA详解 Stanford CS336 Lecture 6 | Stanford Online
1:26:41
-
斯坦福CS336从零构建语言模型 | 2026春 | 第7讲:并行计算 | Stanford Online
1:21:03
-
从零构建语言模型 | Stanford CS336 第八讲:并行计算 | Stanford Online
1:20:11
-
从零构建语言模型:Scaling Laws | Lecture 9 | Stanford CS336 | Stanford Online
1:17:57
-
从零构建语言模型:Inference全解析 | Stanford CS336 Lecture 10 | Stanford Online
1:25:30
-
从零构建语言模型:缩放定律详解 | Stanford CS336 Lecture 11 | Stanford Online
1:17:04
-
斯坦福CS336:从零实现语言模型 | 第十二讲:模型评估 | Stanford Online
1:18:35
-
从零构建语言模型|斯坦福CS336第13讲:数据来源与数据集 | Stanford Online
1:22:02
-
从头构建大语言模型:Stanford CS336第14讲:数据过滤与去重 | Stanford Online
1:24:46
-
从零学语言模型:SFT/RLHF后训练详解 | Stanford CS336 Lecture 15 | Stanford Online
1:19:55
-
从零构建语言模型:后训练与RLVR| Lecture 16 | 斯坦福CS336 | Stanford Online
1:15:51
Description
来源:https://www.youtube.com/watch?v=JpAxdTWQJxM 原标题:Stanford CS336 Language Modeling from Scratch | Spring 2026 | Lecture 12: Evaluation 频道:Stanford Online 发布时间:2026-05-19 内容简介: 本讲是斯坦福大学CS336课程“从零实现语言模型”的第十二讲,主题为“模型评估”。主讲人Percy Liang教授(计算机科学系教授,兼统计学系)与Tatsunori Hashimoto助理教授(计算机科学系)将深入探讨语言模型评估的核心概念与方法。内容涵盖评估指标的选择(如困惑度、BLEU、ROUGE等)、自动化评估与人工评估的权衡、基准数据集的使用,以及如何构建公平、鲁棒的评估流程以衡量模型真实能力。课程旨在帮助学习者理解评估在模型开发中的关键作用,并为后续课程中的模型优化与对比奠定基础。更多课程信息及课表请访问:https://cs336.stanford.edu/