【中英双语+资料】第一个CUDA小项目怎么写|CUDA大师课 矩阵乘+共享内存|CUDA Programming 2026
合集 · AI大模型实战 (8)
-
【中文配音】约翰霍普金斯CUDA并行编程:从核函数到寄存器调优
1:39:58
-
【中英双语+资料】第一个CUDA小项目怎么写|CUDA大师课 矩阵乘+共享内存|CUDA Programming 2026
9:46:00
-
【中英双语】通过5个项目学习PyTorch,学习底层AI必备PyTorch,PyTorch项目实战
11:38:32
-
【中英双语】从零手写Transformer到LLaMA|原片合计145万+ 2023–2024
26:13:29
-
【中文配音+资料】Vizuara从零搭建大语言模型|原片合计178万+·Building LLMs from Scratch 2024
24:40:39
-
【中英双语】12步搞定LLM训练全流程:数据、分词、预训练、LoRA微调,大模型微调
7:00:32
-
【中英双语】伯克利vLLM:PagedAttention生产级推理|原片合计58万+ 2023–2026
19:27:52
-
【中英双语】AI基础设施(AI Infra)全解析:从单卡到千卡集群,GPU/vLLM/LLM-D实战 | KodeKloud
1:36:26
Parts
- P1 · [中文] 01 CUDA小项目开篇
- P2 · [英文] 01 CUDA mini project|完整英文原声在后半部
- P3 · [必看] 1分钟:双语怎么切-充电解锁课程站
- P4 · [中文] 02 Tensor Core编程
- P5 · [中文] 03 图像滤镜与常量内存
- P6 · [中文] 04 GPU矩阵乘法入门
- P7 · [中文] 05 GPU硬件架构
- P8 · [中文] 06 内存合并提速4.5倍
- P9 · [中文] 07 Tiled矩阵乘法
- P10 · [中文] 08 Python GPU加速入门
- P11 · [中文] 09 CuPy环境搭建
- P12 · [中文] 10 Numba自定义内核
- P13 · [中文] 11 Python CUDA进阶
- P14 · [中文] 12 Numba JIT加速
- P15 · [中文] 13 Hello World与向量加
- P16 · [中文] 14 朴素矩阵乘vs cuBLAS
- P17 · [中文] 15 共享内存Tiled乘法
- P18 · [中文] 16 原子归约与Warp Shuffle
- P19 · [中文] 17 GPU架构与Occupancy
- P20 · [中文] 18 PMPP第四章习题
- P21 · [中文] 19 内存合并与矩阵转置
- P22 · [中文] 20 LeetGPU刷题
- P23 · [英文] 02 Tensor Core programming
- P24 · [英文] 03 Image filters
- P25 · [英文] 04 Simple matmul
- P26 · [英文] 05 GPU hardware
- P27 · [英文] 06 Memory coalescing
- P28 · [英文] 07 Tiled matmul
- P29 · [英文] 08 Python CUDA basics
- P30 · [英文] 09 CuPy setup
- P31 · [英文] 10 Numba custom kernels
- P32 · [英文] 11 Advanced Python CUDA
- P33 · [英文] 12 Numba JIT
- P34 · [英文] 13 Hello World vector add
- P35 · [英文] 14 Naive matmul vs cuBLAS
- P36 · [英文] 15 Shared memory tiled
- P37 · [英文] 16 Atomic reduce shuffle
- P38 · [英文] 17 Occupancy
- P39 · [英文] 18 PMPP chapter 4
- P40 · [英文] 19 Coalescing transpose
- P41 · [英文] 20 LeetGPU problems
Description
第一个CUDA小项目怎么写:从 C/C++ 内核到 Python Numba、共享内存与矩阵乘|CUDA Programming Masterclass 2026 📌 本期看点 · 用 NVIDIA 小项目把 CUDA 内核、线程块和网格跑起来 · 矩阵乘法从朴素实现到 Tiled + 共享内存,再对比 cuBLAS · 内存合并、原子归约、Warp Shuffle、Tensor Core 怎么加速 🧭 观看指南 共 20 讲。P1 中文配音,P2 英文原声(完整英文原声在后半部),P3–P21 其余中文配音,P22–P40 其余英文原声。 🎯 适合人群 要写 GPU 内核、做训练加速,或从 Python/C++ 入门 CUDA 的同学。 持续更新海外硬核课程,点赞收藏关注三连,你的支持是更新的最大动力!
Comments
配套资料链接,充电后有权限获取:https://www.bilibili.com/opus/1247124422492422153?spm_id_from=333.1365.0.0