【中文配音】康奈尔大学ECE5545:机器学习硬件与系统|加速器到分布式训练

合集 · 硬件与GPU (28)

  1. 57:00
    【中英双语】显卡每秒36万亿次计算,如何做到?拆解3090 GPU架构 | Branch Education
  2. 28:33
    【中英双语】Intel Arc B60双芯卡实测:4张堆满192GB显存跑大模型
  3. 27:40
    【中文配音】什么样的显卡可以跑本地AI视频生成?实测:RTX 4090/3090/3070/3060四款GPU,覆盖8GB–24GB显存,8GB显存也能跑?
  4. 7:20
    【中文配音】想学AI大模型显卡如何选择?RTX 5070 vs 5060 Ti:AI训练选显卡,吞吐还是内存?
  5. 15:09
    【中文配音】编程素养-缓存未命中:CPU性能的最大隐形杀手,揭示为什么对代码进行简单的修改就能带来 100 倍的性能提升
  6. 39:38
    【中英双语】RTX 5090 vs RTX Pro 6000 AI 大模型对决!闪电版实测
  7. 11:04
    【中文配音】想学大模型?显卡怎么选择?RTX 5070 Ti 16GB值不值得买?本地AI实测
  8. 16:08
    【中英双语】预算4000美元,4张RTX3090本地跑全球最强开源AI模型智谱GLM-5.2,性能比肩GPT-5.5 | Tech-Practice
  9. 12:40
    【中英双语】RTX3090 vs 5090 vs Mac实测:llama.cpp MTP让Qwen3.6-27B推理翻倍
  10. 11:36
    【中英双语】什么样的显卡可以实现本地生成视频?RTX 5090 vs 4090:Wan2.2动画生成速度实测, 全程基于Linux + ComfyUI工作流
  11. 11:36
    【中英双语】RTX5090与RTX4090的Wan 2.2动画速度对比,全程基于ComfyUI工作流,RTX 5090生成视频,RTX 4090生成视频
  12. 19:44
    【中英双语】iPhone的这个漏洞永远修不好,A12/A13芯片直接报废? | Low Level
  13. 19:44
    【中英双语】DeepSeek开源DSpark加速神器:Qwen3本地部署实测,推理速度飙升85% | Fahd Mirza
  14. 13:22
    【中英双语】RTX 3090 vs 5090:2026个人AI本地大模型装机终极选择(deepseek, qwen大模型本地部署,asr tts部署)
  15. 45:28
    【中英双语】手工打造GPU集群:8192核超大规模,半年血泪全记录 | bitluni
  16. 19:38
    【中英双语】显卡显存怎么选?2GB到48GB全解析,十分钟带你了解所有GPU显存容量 | Bit by Bit Explained
  17. 16:50
    【中英双语】[中英语音]程序员必懂CPU vs GPU vs TPU vs DPU vs QPU:五种处理器全解析
  18. 7:28
    【中英双语】GPU编程为什么这么难?数据搬运的代价,颠覆你的认知 | Parallel Routines
  19. 33:56
    【中英双语】如果你还没深刻理解CPU/GPU的差异,请看-> CPU vs GPU:谁才是质数计算之王?
  20. 4:46:42
    【中英双语】NVIDIA GTC 2026 主题演讲,快速了解英伟达
  21. 6:01:54
    【中英双语】从零手把手用Ollama构建RAG、多模态与LLM应用
  22. 17:06
    【中英双语】大模型推理为何吃满GPU内存?揭秘KV Cache机制与显存占用 | Efficient NLP
  23. 2:03:14
    【中英双语】硬核魔改RTX 3070显存翻倍到16GB!手把手挑战NVIDIA | Vex
  24. 9:40
    【中文配音】9分钟搞懂所有GPU黑科技,光线追踪,路径追踪,动态分辨率,HDR,抗锯齿,NVENC硬件编解码
  25. 57:00
    【中英双语】2026必看!显卡GPU架构深度拆解:36万亿次计算如何实现 | Branch Education
  26. 10:44
    【中文配音】DeepSeek V4深度解析:推理成本暴降的秘密
  27. 16:32:10
    【中文配音】康奈尔大学ECE5545:机器学习硬件与系统|加速器到分布式训练
  28. 16:30
    【中英双语】RTX 3090 vs 5090:Qwen3.8-27B本地AI实测,谁更强? | Tech-Practice

Parts

  1. P1 · [中文] 01 课程导论:ML硬件与系统全景
  2. P2 · [中文] 02 DNN计算:算子与计算图怎么吃硬件
  3. P3 · [中文] 03 ML硬件I:指标与Roofline模型
  4. P4 · [中文] 04 ML硬件II:效率从哪里来
  5. P5 · [中文] 05 ML硬件III:加速器案例拆解
  6. P6 · [中文] 06 微架构:数据流与片上存储
  7. P7 · [中文] 07 TinyML:端侧推理怎么做小
  8. P8 · [中文] 08 量化:低比特推理的核心套路
  9. P9 · [中文] 09 剪枝:稀疏化如何换速度
  10. P10 · [中文] 10 嘉宾课:Cerebras Sean Lie
  11. P11 · [中文] 11 知识蒸馏:小模型如何学大模型
  12. P12 · [中文] 12 神经架构搜索NAS
  13. P13 · [中文] 13 Kernel计算:算子落地到硬件
  14. P14 · [中文] 14 Mapping:算子如何映射到加速器
  15. P15 · [中文] 15 嘉宾课:TVM Thierry Moreau
  16. P16 · [中文] 16 前后处理:ML系统里常被忽略的一半
  17. P17 · [中文] 17 分布式训练:多机多卡怎么扩
  18. P18 · [中文] 18 联邦学习:数据不出域怎么训
  19. P19 · [中文] 19 环境与伦理:ML系统的外部成本
  20. P20 · Cornell ECE 5545: Guest Lecture: SemiAnalysis Kimbo Chen
Description
Cornell ECE 5545《机器学习硬件与系统》完整课|2022|中文配音

📌 本期看点
· DNN 计算与硬件指标:Roofline、能效与典型加速器案例
· 微架构与 TinyML:端侧推理怎么做小、做快
· 模型压缩:量化、剪枝、知识蒸馏与神经架构搜索
· 系统侧:Kernel/Mapping、前后处理、分布式训练与联邦学习
· 嘉宾课:Cerebras / TVM / SemiAnalysis 一线视角

🧭 观看指南
共 20 讲,均为中文配音版,按课程顺序排列(含 3 场嘉宾课)。

🎯 适合人群
做 ML 系统/加速器、想从算法侧补硬件与系统栈的转码/研一与工程师。

持续更新海外名校硬核课程,点赞收藏关注三连,你的支持是更新的最大动力!