【中英双语】约翰霍普金斯大学 GPU编程④:cuFFT到cuDNN高级库 2023

合集 · 硬件与GPU (32)

  1. 57:00
    【中英双语】显卡每秒36万亿次计算,如何做到?拆解3090 GPU架构 | Branch Education
  2. 28:33
    【中英双语】Intel Arc B60双芯卡实测:4张堆满192GB显存跑大模型
  3. 27:40
    【中文配音】什么样的显卡可以跑本地AI视频生成?实测:RTX 4090/3090/3070/3060四款GPU,覆盖8GB–24GB显存,8GB显存也能跑?
  4. 7:20
    【中文配音】想学AI大模型显卡如何选择?RTX 5070 vs 5060 Ti:AI训练选显卡,吞吐还是内存?
  5. 15:09
    【中文配音】编程素养-缓存未命中:CPU性能的最大隐形杀手,揭示为什么对代码进行简单的修改就能带来 100 倍的性能提升
  6. 39:38
    【中英双语】RTX 5090 vs RTX Pro 6000 AI 大模型对决!闪电版实测
  7. 11:04
    【中文配音】想学大模型?显卡怎么选择?RTX 5070 Ti 16GB值不值得买?本地AI实测
  8. 16:08
    【中英双语】预算4000美元,4张RTX3090本地跑全球最强开源AI模型智谱GLM-5.2,性能比肩GPT-5.5 | Tech-Practice
  9. 12:40
    【中英双语】RTX3090 vs 5090 vs Mac实测:llama.cpp MTP让Qwen3.6-27B推理翻倍
  10. 11:36
    【中英双语】什么样的显卡可以实现本地生成视频?RTX 5090 vs 4090:Wan2.2动画生成速度实测, 全程基于Linux + ComfyUI工作流
  11. 11:36
    【中英双语】RTX5090与RTX4090的Wan 2.2动画速度对比,全程基于ComfyUI工作流,RTX 5090生成视频,RTX 4090生成视频
  12. 19:44
    【中英双语】iPhone的这个漏洞永远修不好,A12/A13芯片直接报废? | Low Level
  13. 19:44
    【中英双语】DeepSeek开源DSpark加速神器:Qwen3本地部署实测,推理速度飙升85% | Fahd Mirza
  14. 13:22
    【中英双语】RTX 3090 vs 5090:2026个人AI本地大模型装机终极选择(deepseek, qwen大模型本地部署,asr tts部署)
  15. 45:28
    【中英双语】手工打造GPU集群:8192核超大规模,半年血泪全记录 | bitluni
  16. 19:38
    【中英双语】显卡显存怎么选?2GB到48GB全解析,十分钟带你了解所有GPU显存容量 | Bit by Bit Explained
  17. 16:50
    【中英双语】[中英语音]程序员必懂CPU vs GPU vs TPU vs DPU vs QPU:五种处理器全解析
  18. 7:28
    【中英双语】GPU编程为什么这么难?数据搬运的代价,颠覆你的认知 | Parallel Routines
  19. 33:56
    【中英双语】如果你还没深刻理解CPU/GPU的差异,请看-> CPU vs GPU:谁才是质数计算之王?
  20. 4:46:42
    【中英双语】NVIDIA GTC 2026 主题演讲,快速了解英伟达
  21. 6:01:54
    【中英双语】从零手把手用Ollama构建RAG、多模态与LLM应用
  22. 17:06
    【中英双语】大模型推理为何吃满GPU内存?揭秘KV Cache机制与显存占用 | Efficient NLP
  23. 2:03:14
    【中英双语】硬核魔改RTX 3070显存翻倍到16GB!手把手挑战NVIDIA | Vex
  24. 9:40
    【中文配音】9分钟搞懂所有GPU黑科技,光线追踪,路径追踪,动态分辨率,HDR,抗锯齿,NVENC硬件编解码
  25. 57:00
    【中英双语】2026必看!显卡GPU架构深度拆解:36万亿次计算如何实现 | Branch Education
  26. 10:44
    【中文配音】DeepSeek V4深度解析:推理成本暴降的秘密
  27. 16:32:10
    【中文配音】康奈尔大学ECE5545:机器学习硬件与系统|加速器到分布式训练
  28. 16:30
    【中英双语】RTX 3090 vs 5090:Qwen3.8-27B本地AI实测,谁更强? | Tech-Practice
  29. 4:08:51
    【中英双语】约翰霍普金斯大学 GPU编程①:并发与CUDA入门 2023
  30. 3:45:07
    【中英双语】约翰霍普金斯大学 GPU编程②:CUDA并行编程 2023
  31. 3:49:06
    【中英双语】约翰霍普金斯大学 GPU编程④:cuFFT到cuDNN高级库 2023
  32. 5:19:03
    【中英双语】约翰霍普金斯大学 GPU编程③:CUDA多GPU与异步流 2023

Parts

  1. P1 · [中文] 01 GPU编程进阶:CUDA高级库实战,cuDNN加速深度学习
  2. P2 · [中文] 02 约翰霍普金斯GPU课程:CUDA核心库cuDNN/cuBLAS实战,从入门到机器学习应用
  3. P3 · [中文] 03 CUDA高级库实战:cuDNN/cuTensor加速深度学习全流程
  4. P4 · [中文] 04 GPU专项课程终极项目:用CUDA库打造你的机器学习应用
  5. P5 · [中文] 05 GPU加速FFT性能实测:cuFFT比CPU快多少?
  6. P6 · [中文] 06 cuFFT语法实战:CUDA傅里叶变换从入门到会用
  7. P7 · [中文] 07 GPU编程必学:cuFFT数据类型全解析,手把手教你用CUDA做傅里叶变换
  8. P8 · [中文] 08 GPU图像处理实战:用cuFFT检测模糊照片,约翰霍普金斯官方课程
  9. P9 · [中文] 09 GPU音频信号处理实战:cuFFT语音识别全流程
  10. P10 · [中文] 10 GPU图像处理实战:cuFFT矩阵乘法与傅里叶变换全流程
  11. P11 · [中文] 11 线性代数速成:CUDA矩阵运算核心,GPU加速从这开始
  12. P12 · [中文] 12 CUDA cuBLAS库语法详解:从初始化到向量运算,GPU线性代数加速实战
  13. P13 · [中文] 13 cuSOLVER实战:CUDA线性代数库求解方程组,GPU加速矩阵分解
  14. P14 · [中文] 14 CUDA稀疏矩阵加速实战:cuSPARSE库从入门到精通
  15. P15 · [中文] 15 约翰霍普金斯GPU编程:NVBLAS多GPU线性代数库实战
  16. P16 · [中文] 16 约翰霍普金斯GPU课程:CUDA线性代数库实战,cuBLAS/cuSolver/cuSparse全解析
  17. P17 · [中文] 17 Thrust向量语法实战:CUDA高级库核心,约翰霍普金斯GPU课程
  18. P18 · [中文] 18 CUDA Thrust向量迭代器:GPU编程高效数据操作
  19. P19 · [中文] 19 函数式编程:让你的CUDA代码更简洁高效
  20. P20 · [中文] 20 Thrust数据转换:CUDA并行算法实战,向量操作全解析
  21. P21 · [中文] 21 Thrust库数据归约实战:CUDA并行求和与极值操作全解析
  22. P22 · [中文] 22 Thrust库数据重排与排序:GPU分区操作实战,优化Warp效率
  23. P23 · [中文] 23 Thrust库实战:CUDA并行排序与键值对处理全流程
  24. P24 · [中文] 24 约翰霍普金斯GPU课程:用CUDA高级库玩转神经网络,cuDNN实战
  25. P25 · [中文] 25 cuDNN语法详解:PyTorch/TensorFlow底层都在用的GPU加速库
  26. P26 · [中文] 26 cuTensor语法实战:约翰霍普金斯GPU课程带你掌握张量收缩
  27. P27 · [中文] 27 GPU编程高级库:cuTensor语法实战,约翰霍普金斯官方课程
  28. P28 · [中文] 28 约翰霍普金斯GPU课程:cuTensor实战,用CUDA加速AI计算
  29. P29 · [中文] 29 GPU专项顶点项目:用CUDA库打造你的机器学习应用
  30. P30 · [英文] 01 GPU Programming Specialization
  31. P31 · [英文] 02 Course Expectations
  32. P32 · [英文] 03 Coursera Lab and Assignment Overview
  33. P33 · [英文] 04 GPU Specialization Capstone Project
  34. P34 · [英文] 05 cuFFT Performance and Features
  35. P35 · [英文] 06 cuFFT Syntax
  36. P36 · [英文] 07 cuFFT Data Types
  37. P37 · [英文] 08 cuFFT Image/Video Processing
  38. P38 · [英文] 09 cuFFT Audio/Signals Processing
  39. P39 · [英文] 10 cuFFT Lab and Assignment Overview
  40. P40 · [英文] 11 Introduction to Linear Algebra
  41. P41 · [英文] 12 cuBLAS Syntax
  42. P42 · [英文] 13 cuSOLVER Syntax
  43. P43 · [英文] 14 cuSPARSE Syntax
  44. P44 · [英文] 15 NBLAS Syntax
  45. P45 · [英文] 16 CUDA Linear Algebra Lab and Assignment Overview
  46. P46 · [英文] 17 Thrust Vector Syntax
  47. P47 · [英文] 18 Thrust Vector Iterator
  48. P48 · [英文] 19 Functional Programming
  49. P49 · [英文] 20 Thrust Data Transformation
  50. P50 · [英文] 21 Thrust Data Reduction
  51. P51 · [英文] 22 Thrust Data Reorder and Sorting
  52. P52 · [英文] 23 Thrust Lab and Assignment Overview
  53. P53 · [英文] 24 Introduction to Neural Networks
  54. P54 · [英文] 25 cuDNN Syntax
  55. P55 · [英文] 26 cuTensor Syntax Part 1
  56. P56 · [英文] 27 cuTensor Syntax Part 2
  57. P57 · [英文] 28 Lab Activity Overview
  58. P58 · [英文] 29 Capstone Project
Description
约翰霍普金斯大学《GPU编程》专项④:CUDA高级库|cuFFT、cuBLAS、Thrust、cuDNN|中英双语可切换

📌 本期看点
· cuFFT / cuBLAS / cuSOLVER / cuSPARSE:线性代数与变换怎么调库
· Thrust 向量、变换、归约与排序:少写 Kernel 也能并行
· cuDNN / cuTensor:深度学习底层加速怎么接到自己的代码

🧭 观看指南
共29讲。P1–P29 为中文配音版,P30–P58 为英文原声版,可按需切换。

🎯 适合人群
会一点 CUDA、想用官方库做 FFT/线性代数/深度学习加速的开发者与研究生。

持续更新海外名校硬核课程,点赞收藏关注三连,你的支持是更新的最大动力!

Comments

名校课程-顶级中配 4d ago

往期精彩视频推荐: https://www.bilibili.com/video/BV1EKtv6PEpt https://www.bilibili.com/video/BV1rLtR6ZEVU https://www.bilibili.com/video/BV1CXtR6YEKM https://www.bilibili.com/video/BV1AFtU61EiN https://www.bilibili.com/video/BV1umtm69EuU 📚 配套增值服务 学习站已上线 5 大学习路线(AI大模型 / 计算机本科 / C++就业 / 嵌入式 / 金融创业),指定翻译课程配完整图文教程 📖 学习站介绍与路线入口(含截图):https://www.bilibili.com/read/cv51492046 ⚡ 充电支持后私信 UP主开通对应课程 (部分课程另含中英对照精读,以开通清单为准)