【中英双语】约翰霍普金斯大学 GPU编程③:CUDA多GPU与异步流 2023
合集 · 硬件与GPU (32)
-
【中英双语】显卡每秒36万亿次计算,如何做到?拆解3090 GPU架构 | Branch Education
57:00
-
【中英双语】Intel Arc B60双芯卡实测:4张堆满192GB显存跑大模型
28:33
-
【中文配音】什么样的显卡可以跑本地AI视频生成?实测:RTX 4090/3090/3070/3060四款GPU,覆盖8GB–24GB显存,8GB显存也能跑?
27:40
-
【中文配音】想学AI大模型显卡如何选择?RTX 5070 vs 5060 Ti:AI训练选显卡,吞吐还是内存?
7:20
-
【中文配音】编程素养-缓存未命中:CPU性能的最大隐形杀手,揭示为什么对代码进行简单的修改就能带来 100 倍的性能提升
15:09
-
【中英双语】RTX 5090 vs RTX Pro 6000 AI 大模型对决!闪电版实测
39:38
-
【中文配音】想学大模型?显卡怎么选择?RTX 5070 Ti 16GB值不值得买?本地AI实测
11:04
-
【中英双语】预算4000美元,4张RTX3090本地跑全球最强开源AI模型智谱GLM-5.2,性能比肩GPT-5.5 | Tech-Practice
16:08
-
【中英双语】RTX3090 vs 5090 vs Mac实测:llama.cpp MTP让Qwen3.6-27B推理翻倍
12:40
-
【中英双语】什么样的显卡可以实现本地生成视频?RTX 5090 vs 4090:Wan2.2动画生成速度实测, 全程基于Linux + ComfyUI工作流
11:36
-
【中英双语】RTX5090与RTX4090的Wan 2.2动画速度对比,全程基于ComfyUI工作流,RTX 5090生成视频,RTX 4090生成视频
11:36
-
【中英双语】iPhone的这个漏洞永远修不好,A12/A13芯片直接报废? | Low Level
19:44
-
【中英双语】DeepSeek开源DSpark加速神器:Qwen3本地部署实测,推理速度飙升85% | Fahd Mirza
19:44
-
【中英双语】RTX 3090 vs 5090:2026个人AI本地大模型装机终极选择(deepseek, qwen大模型本地部署,asr tts部署)
13:22
-
【中英双语】手工打造GPU集群:8192核超大规模,半年血泪全记录 | bitluni
45:28
-
【中英双语】显卡显存怎么选?2GB到48GB全解析,十分钟带你了解所有GPU显存容量 | Bit by Bit Explained
19:38
-
【中英双语】[中英语音]程序员必懂CPU vs GPU vs TPU vs DPU vs QPU:五种处理器全解析
16:50
-
【中英双语】GPU编程为什么这么难?数据搬运的代价,颠覆你的认知 | Parallel Routines
7:28
-
【中英双语】如果你还没深刻理解CPU/GPU的差异,请看-> CPU vs GPU:谁才是质数计算之王?
33:56
-
【中英双语】NVIDIA GTC 2026 主题演讲,快速了解英伟达
4:46:42
-
【中英双语】从零手把手用Ollama构建RAG、多模态与LLM应用
6:01:54
-
【中英双语】大模型推理为何吃满GPU内存?揭秘KV Cache机制与显存占用 | Efficient NLP
17:06
-
【中英双语】硬核魔改RTX 3070显存翻倍到16GB!手把手挑战NVIDIA | Vex
2:03:14
-
【中文配音】9分钟搞懂所有GPU黑科技,光线追踪,路径追踪,动态分辨率,HDR,抗锯齿,NVENC硬件编解码
9:40
-
【中英双语】2026必看!显卡GPU架构深度拆解:36万亿次计算如何实现 | Branch Education
57:00
-
【中文配音】DeepSeek V4深度解析:推理成本暴降的秘密
10:44
-
【中文配音】康奈尔大学ECE5545:机器学习硬件与系统|加速器到分布式训练
16:32:10
-
【中英双语】RTX 3090 vs 5090:Qwen3.8-27B本地AI实测,谁更强? | Tech-Practice
16:30
-
【中英双语】约翰霍普金斯大学 GPU编程①:并发与CUDA入门 2023
4:08:51
-
【中英双语】约翰霍普金斯大学 GPU编程②:CUDA并行编程 2023
3:45:07
-
【中英双语】约翰霍普金斯大学 GPU编程④:cuFFT到cuDNN高级库 2023
3:49:06
-
【中英双语】约翰霍普金斯大学 GPU编程③:CUDA多GPU与异步流 2023
5:19:03
Parts
- P1 · [中文] 01 约翰霍普金斯GPU编程:多GPU异步流实战,CUDA规模化应用全解析
- P2 · [中文] 02 多GPU异步流实战:CUDA事件与流全解析
- P3 · [中文] 03 CUDA多GPU异步流实战:约翰霍普金斯名校课带你搞定并行编程
- P4 · [中文] 04 多CPU架构实战:从文件系统到消息队列,掌握多机通信核心
- P5 · [中文] 05 多CPU并行实战:CUDA异步流与事件同步全解析
- P6 · [中文] 06 CUDA多CPU分配实战:约翰霍普金斯GPU编程作业全解析
- P7 · [中文] 07 多CPU vs 多GPU:谁才是并行计算之王?约翰霍普金斯CUDA课
- P8 · [中文] 08 CUDA多GPU编程实战:从入门到精通,约翰霍普金斯名校课程
- P9 · [中文] 09 多GPU实战:CUDA异步流与事件全解析
- P10 · [中文] 10 多GPU实战:CUDA异步流与事件,手把手教你管理多卡并行
- P11 · [中文] 11 CUDA多GPU异步流实战:Streams和Events高效并行
- P12 · [中文] 12 CUDA流语法全解析:异步编程与多GPU实战
- P13 · [中文] 13 CUDA事件API语法详解:多GPU异步流同步控制
- P14 · [中文] 14 CUDA流与事件实战:异步多GPU编程,约翰霍普金斯名校课
- P15 · [中文] 15 CUDA流与事件实战:多GPU异步编程作业全解析
- P16 · [中文] 16 CUDA伪代码实战:用输入数据设计GPU算法,约翰霍普金斯公开课
- P17 · [中文] 17 GPU排序算法为什么这么难?冒泡/基数/快排全解析
- P18 · [中文] 18 GPU排序算法实战:基数排序伪代码全解析,CUDA并行编程必学
- P19 · [中文] 19 GPU快速排序有多快?约翰霍普金斯CUDA专家现场演示
- P20 · [中文] 20 GPU冒泡排序伪代码:内存与线程同步实战
- P21 · [中文] 21 GPU基数排序实战:内存优化与CUDA伪代码全解析
- P22 · [中文] 22 GPU快速排序有多快?内存伪代码实战解析
- P23 · [中文] 23 冒泡排序在GPU上能跑多快?CUDA排序算法实验
- P24 · [中文] 24 CUDA基数排序实战:用GPU加速大规模数据排序,性能提升看得见
- P25 · [中文] 25 快速排序CUDA实战:从经典伪代码到GPU并行排序
- P26 · [中文] 26 CUDA归并排序实战:GPU并行排序从入门到掌握
- P27 · [中文] 27 CUDA图像处理神器NPP:手把手教你用GPU加速图像算法
- P28 · [中文] 28 CUDA图像处理实战:NPP库5x5滤波全流程演示
- P29 · [中文] 29 CUDA信号处理实战:NPP库高效处理音频与波形数据
- P30 · [中文] 30 CUDA信号处理实战:NPP库均值滤波与异步流全解析
- P31 · [中文] 31 约翰霍普金斯GPU编程实战:CUDA多GPU异步流与图像处理全流程
- P32 · [中文] 32 约翰霍普金斯CUDA实战:独立项目全流程,多GPU异步流+图像处理
- P33 · [中文] 33 CUDA多GPU异步流实战:约翰霍普金斯GPU编程项目评分标准全解析
- P34 · [英文] 01 GPU Specialization Overview
- P35 · [英文] 02 Course Expectations
- P36 · [英文] 03 Coursera Lab and Assignment Overview
- P37 · [英文] 04 Multiple CPU Architectures
- P38 · [英文] 05 Multiple CPU Lab
- P39 · [英文] 06 Multiple CPU Assignment
- P40 · [英文] 07 Multiple CPUs vs Multiple GPUs
- P41 · [英文] 08 CUDA Multiple GPU Programming Model
- P42 · [英文] 09 Multiple GPU Activity
- P43 · [英文] 10 Multiple GPU Assignment
- P44 · [英文] 11 CUDA Streams and Events
- P45 · [英文] 12 CUDA Streams Syntax
- P46 · [英文] 13 CUDA Events Syntax
- P47 · [英文] 14 CUDA Streams and Events Use Cases
- P48 · [英文] 15 CUDA Streams and Events Assignment Walkthrough
- P49 · [英文] 16 Using Input Data to Develop GPU Pseudocode
- P50 · [英文] 17 Sorting Algorithm GPU Pseudocode Bubble Sort
- P51 · [英文] 18 Sorting Algorithm GPU Pseudocode Radix Sort
- P52 · [英文] 19 Sorting Algorithm GPU Pseudocode Quick Sort
- P53 · [英文] 20 Memory and GPU Pseudocode Bubble Sort
- P54 · [英文] 21 Memory and GPU Pseudocode Radix Sort
- P55 · [英文] 22 Memory and GPU Pseudocode Quick Sort
- P56 · [英文] 23 Sorting Algorithms Lab Activity Bubble Sort
- P57 · [英文] 24 Sorting Algorithms Lab Activity Radix Sort
- P58 · [英文] 25 Sorting Algorithms Lab Activity Quick Sort
- P59 · [英文] 26 Sorting Algorithms Assignment
- P60 · [英文] 27 NPP Image Processing Syntax
- P61 · [英文] 28 NPP Image Processing Code Demonstration
- P62 · [英文] 29 NPP Signal Processing Syntax
- P63 · [英文] 30 NPP Signals Processing Syntax Demonstration
- P64 · [英文] 31 Course Independent Project Lab Overview
- P65 · [英文] 32 Course Independent Project Overview
- P66 · [英文] 33 Course Independent Project Rubric Overview
Description
约翰霍普金斯大学《GPU编程》专项③:CUDA at Scale|多GPU、异步流与排序|中英双语可切换 📌 本期看点 · 多CPU vs 多GPU:把规模化并行的分工先讲清 · CUDA Streams / Events:异步重叠计算与拷贝 · 冒泡/基数/快排 GPU 伪代码,以及 NPP 图像与信号处理 🧭 观看指南 共33讲。P1–P33 为中文配音版,P34–P66 为英文原声版,可按需切换。 🎯 适合人群 已会 CUDA Kernel、想上多卡与异步流的计算机学生和高性能计算开发者。 持续更新海外名校硬核课程,点赞收藏关注三连,你的支持是更新的最大动力!