【中英双语+资料】第一个CUDA小项目怎么写|CUDA大师课 矩阵乘+共享内存|CUDA Programming 2026

合集 · AI大模型实战 (8)

  1. 1:39:58
    【中文配音】约翰霍普金斯CUDA并行编程:从核函数到寄存器调优
  2. 9:46:00
    【中英双语+资料】第一个CUDA小项目怎么写|CUDA大师课 矩阵乘+共享内存|CUDA Programming 2026
  3. 11:38:32
    【中英双语】通过5个项目学习PyTorch,学习底层AI必备PyTorch,PyTorch项目实战
  4. 26:13:29
    【中英双语】从零手写Transformer到LLaMA|原片合计145万+ 2023–2024
  5. 24:40:39
    【中文配音+资料】Vizuara从零搭建大语言模型|原片合计178万+·Building LLMs from Scratch 2024
  6. 7:00:32
    【中英双语】12步搞定LLM训练全流程:数据、分词、预训练、LoRA微调,大模型微调
  7. 19:27:52
    【中英双语】伯克利vLLM:PagedAttention生产级推理|原片合计58万+ 2023–2026
  8. 1:36:26
    【中英双语】AI基础设施(AI Infra)全解析:从单卡到千卡集群,GPU/vLLM/LLM-D实战 | KodeKloud

Parts

  1. P1 · [中文] 01 CUDA小项目开篇
  2. P2 · [英文] 01 CUDA mini project|完整英文原声在后半部
  3. P3 · [必看] 1分钟:双语怎么切-充电解锁课程站
  4. P4 · [中文] 02 Tensor Core编程
  5. P5 · [中文] 03 图像滤镜与常量内存
  6. P6 · [中文] 04 GPU矩阵乘法入门
  7. P7 · [中文] 05 GPU硬件架构
  8. P8 · [中文] 06 内存合并提速4.5倍
  9. P9 · [中文] 07 Tiled矩阵乘法
  10. P10 · [中文] 08 Python GPU加速入门
  11. P11 · [中文] 09 CuPy环境搭建
  12. P12 · [中文] 10 Numba自定义内核
  13. P13 · [中文] 11 Python CUDA进阶
  14. P14 · [中文] 12 Numba JIT加速
  15. P15 · [中文] 13 Hello World与向量加
  16. P16 · [中文] 14 朴素矩阵乘vs cuBLAS
  17. P17 · [中文] 15 共享内存Tiled乘法
  18. P18 · [中文] 16 原子归约与Warp Shuffle
  19. P19 · [中文] 17 GPU架构与Occupancy
  20. P20 · [中文] 18 PMPP第四章习题
  21. P21 · [中文] 19 内存合并与矩阵转置
  22. P22 · [中文] 20 LeetGPU刷题
  23. P23 · [英文] 02 Tensor Core programming
  24. P24 · [英文] 03 Image filters
  25. P25 · [英文] 04 Simple matmul
  26. P26 · [英文] 05 GPU hardware
  27. P27 · [英文] 06 Memory coalescing
  28. P28 · [英文] 07 Tiled matmul
  29. P29 · [英文] 08 Python CUDA basics
  30. P30 · [英文] 09 CuPy setup
  31. P31 · [英文] 10 Numba custom kernels
  32. P32 · [英文] 11 Advanced Python CUDA
  33. P33 · [英文] 12 Numba JIT
  34. P34 · [英文] 13 Hello World vector add
  35. P35 · [英文] 14 Naive matmul vs cuBLAS
  36. P36 · [英文] 15 Shared memory tiled
  37. P37 · [英文] 16 Atomic reduce shuffle
  38. P38 · [英文] 17 Occupancy
  39. P39 · [英文] 18 PMPP chapter 4
  40. P40 · [英文] 19 Coalescing transpose
  41. P41 · [英文] 20 LeetGPU problems
Description
第一个CUDA小项目怎么写:从 C/C++ 内核到 Python Numba、共享内存与矩阵乘|CUDA Programming Masterclass 2026

📌 本期看点
· 用 NVIDIA 小项目把 CUDA 内核、线程块和网格跑起来
· 矩阵乘法从朴素实现到 Tiled + 共享内存,再对比 cuBLAS
· 内存合并、原子归约、Warp Shuffle、Tensor Core 怎么加速

🧭 观看指南
共 20 讲。P1 中文配音,P2 英文原声(完整英文原声在后半部),P3–P21 其余中文配音,P22–P40 其余英文原声。

🎯 适合人群
要写 GPU 内核、做训练加速,或从 Python/C++ 入门 CUDA 的同学。

持续更新海外硬核课程,点赞收藏关注三连,你的支持是更新的最大动力!

Comments

名校课程-顶级中配 4d ago

配套资料链接,充电后有权限获取:https://www.bilibili.com/opus/1247124422492422153?spm_id_from=333.1365.0.0