【中英双语】GPU编程为什么这么难?数据搬运的代价,颠覆你的认知 | Parallel Routines
合集 · 硬件与GPU (28)
-
【中英双语】显卡每秒36万亿次计算,如何做到?拆解3090 GPU架构 | Branch Education
57:00
-
【中英双语】Intel Arc B60双芯卡实测:4张堆满192GB显存跑大模型
28:33
-
【中文配音】什么样的显卡可以跑本地AI视频生成?实测:RTX 4090/3090/3070/3060四款GPU,覆盖8GB–24GB显存,8GB显存也能跑?
27:40
-
【中文配音】想学AI大模型显卡如何选择?RTX 5070 vs 5060 Ti:AI训练选显卡,吞吐还是内存?
7:20
-
【中文配音】编程素养-缓存未命中:CPU性能的最大隐形杀手,揭示为什么对代码进行简单的修改就能带来 100 倍的性能提升
15:09
-
【中英双语】RTX 5090 vs RTX Pro 6000 AI 大模型对决!闪电版实测
39:38
-
【中文配音】想学大模型?显卡怎么选择?RTX 5070 Ti 16GB值不值得买?本地AI实测
11:04
-
【中英双语】预算4000美元,4张RTX3090本地跑全球最强开源AI模型智谱GLM-5.2,性能比肩GPT-5.5 | Tech-Practice
16:08
-
【中英双语】RTX3090 vs 5090 vs Mac实测:llama.cpp MTP让Qwen3.6-27B推理翻倍
12:40
-
【中英双语】什么样的显卡可以实现本地生成视频?RTX 5090 vs 4090:Wan2.2动画生成速度实测, 全程基于Linux + ComfyUI工作流
11:36
-
【中英双语】RTX5090与RTX4090的Wan 2.2动画速度对比,全程基于ComfyUI工作流,RTX 5090生成视频,RTX 4090生成视频
11:36
-
【中英双语】iPhone的这个漏洞永远修不好,A12/A13芯片直接报废? | Low Level
19:44
-
【中英双语】DeepSeek开源DSpark加速神器:Qwen3本地部署实测,推理速度飙升85% | Fahd Mirza
19:44
-
【中英双语】RTX 3090 vs 5090:2026个人AI本地大模型装机终极选择(deepseek, qwen大模型本地部署,asr tts部署)
13:22
-
【中英双语】手工打造GPU集群:8192核超大规模,半年血泪全记录 | bitluni
45:28
-
【中英双语】显卡显存怎么选?2GB到48GB全解析,十分钟带你了解所有GPU显存容量 | Bit by Bit Explained
19:38
-
【中英双语】[中英语音]程序员必懂CPU vs GPU vs TPU vs DPU vs QPU:五种处理器全解析
16:50
-
【中英双语】GPU编程为什么这么难?数据搬运的代价,颠覆你的认知 | Parallel Routines
7:28
-
【中英双语】如果你还没深刻理解CPU/GPU的差异,请看-> CPU vs GPU:谁才是质数计算之王?
33:56
-
【中英双语】NVIDIA GTC 2026 主题演讲,快速了解英伟达
4:46:42
-
【中英双语】从零手把手用Ollama构建RAG、多模态与LLM应用
6:01:54
-
【中英双语】大模型推理为何吃满GPU内存?揭秘KV Cache机制与显存占用 | Efficient NLP
17:06
-
【中英双语】硬核魔改RTX 3070显存翻倍到16GB!手把手挑战NVIDIA | Vex
2:03:14
-
【中文配音】9分钟搞懂所有GPU黑科技,光线追踪,路径追踪,动态分辨率,HDR,抗锯齿,NVENC硬件编解码
9:40
-
【中英双语】2026必看!显卡GPU架构深度拆解:36万亿次计算如何实现 | Branch Education
57:00
-
【中文配音】DeepSeek V4深度解析:推理成本暴降的秘密
10:44
-
【中文配音】康奈尔大学ECE5545:机器学习硬件与系统|加速器到分布式训练
16:32:10
-
【中英双语】RTX 3090 vs 5090:Qwen3.8-27B本地AI实测,谁更强? | Tech-Practice
16:30
Parts
Description
GPU编程的复杂性并非偶然,根源在于数据移动的代价。本视频从ENIAC的物理布线讲到冯·诺依曼瓶颈,深入解析现代GPU的内存与执行层次结构,揭示性能优化的核心:缩短数据与计算的距离。 🎬 章节 00:00 GPU为何如此复杂 00:04 内存与执行层次结构 00:33 为何感觉复杂 00:35 追溯计算起源 00:41 软件出现之前 ENIAC 00:44 物理控制与重新布线 01:06 激进想法 存储程序 01:28 处理器越来越快 01:37 内存落后了 01:49 冯·诺依曼瓶颈 02:05 三条架构路径 02:10 CPU 简单但受限 02:22 GPU 用层次对抗内存限制 02:48 神经形态系统 03:05 性能的真正来源 03:15 GPU复杂性并非偶然