不增加线程和核心,代码怎么跑得更快?
合集 · 直观理解计算机技术【CoreDumped】 (68)
-
代码中指定变量类型为何如此重要?
11:03
-
栈为何如此之快?
13:46
-
堆为何如此之慢?
17:53
-
动态数组的内部机制(ArrayList VS LinkedList)
19:56
-
探索计算机并发与多任务处理的历史
15:37
-
晶体管是如何运行代码的?
12:54
-
晶体管是如何记忆数据的?
16:12
-
制作一个CPU来运行程序
18:47
-
计算机如何将字符串转换为数字
11:23
-
动态随机存取存储器(DRAM)的工作原理
17:18
-
计算机处理器是如何运行条件和循环的?
16:05
-
一个程序不是一个进程
6:51
-
深入理解进程,如何进行上下文切换?计算机科学中最深刻和最成功的想法之一。
14:52
-
处理器内部的单个位如何保护操作系统的完整性?
20:20
-
计算的心跳:时钟如何推动 CPU 前进?
13:14
-
英语原声版-计算的心跳:时钟如何推动 CPU 前进?
14:22
-
(英语原声)进程间通信:共享内存或发送消息
14:15
-
(中文配音)进程间通信:共享内存或发送消息
12:29
-
(中文配音)为什么单核处理器需要线程?
14:59
-
(英语原声)为什么单核处理器需要线程?
16:07
-
(中文配音)多核系统上的线程
9:26
-
(英语原声)多核系统上的线程
11:27
-
(中文配音)为什么应用程序是特定于操作系统的?
11:52
-
(英语原声)为什么应用程序是特定于操作系统的?
13:09
-
(英语原声)硬件如何在多任务处理中协助软件?
13:15
-
(中文配音)硬件如何在多任务处理中协助软件?
11:29
-
链表的一个实际应用
20:34
-
让你的电脑运行更流畅的奇妙算法
45:02
-
(流畅中文配音)让你的电脑运行更流畅的奇妙算法
43:38
-
(原声双语字幕)当程序调用 sleep() 时会发生什么?
19:41
-
(流畅中文配音)当程序调用 sleep() 时会发生什么?
17:57
-
这个简单算法驱动了真正的解释器:Pratt Parsing
20:40
-
(双语字幕)编程中最难以捉摸的Bug:竞态条件
18:19
-
(流畅中文配音)编程中最难以捉摸的Bug:竞态条件
19:23
-
(中文配音)阻止内存攻击的底层电路
16:02
-
(英语原声)阻止内存攻击的底层电路
14:51
-
为什么有些项目会使用多种编程语言?
18:04
-
为什么有些项目会使用多种编程语言?
19:32
-
别再杀进程了!让 Ctrl+C 变成“喵”……(用信号实现)
17:15
-
别再杀进程了!让 Ctrl+C 变成“喵”...(用信号实现)
19:23
-
80 年代避免竞态条件的算法(以及它为何失败)
19:05
-
80 年代避免竞态条件的算法(以及它为何失败)
19:43
-
CPU如何与众多不同设备交互?
22:10
-
(中文配音)CPU如何与众多不同设备交互?
23:52
-
(中文配音)你每天都在用的奇特CPU操作
14:04
-
你每天都在用的奇特CPU操作
13:04
-
(中文配音)历史如何塑造了我们今天仍在使用的编程术语?
18:04
-
(英语原声)历史如何塑造了我们今天仍在使用的编程术语?
17:42
-
为什么有些底层项目里会充满这种奇怪的代码?
16:41
-
(中文配音)为什么有些底层项目里会充满这种奇怪的代码?
16:39
-
编译与解释代码如何共处同一程序中?
21:35
-
(英语原声)编译与解释代码如何共处同一程序中?
21:30
-
【双语字幕】Core Dumped 常见问题的集中回答
17:09
-
【双语字幕】90年代的设计决策阻碍了Python并行化
13:36
-
【中文配音】90年代的设计决策阻碍了Python并行化
12:01
-
Linux创建进程的奇怪方式
17:51
-
【中文配音】Linux创建进程的奇怪方式
18:14
-
CPU如何运行函数?
19:49
-
【中文配音】CPU如何运行函数?
19:38
-
没有人解释的问题:内核的边界在哪里?
17:15
-
【英语原声】没有人解释的问题:内核的边界在哪里?
19:36
-
硬件如何让线程问题不再那么棘手?
35:49
-
为什么在macOS、Windows和Linux上安装应用程序如此不同?
19:47
-
游戏公司真的能破坏你的电脑吗?
24:00
-
一个视频说透“架构”:为什么你的程序换个CPU就可能跑不了?
10:43
-
CPU如何执行有符号和无符号运算?
14:45
-
简单指令, 奇妙算法
19:11
-
当CPU遇到它不认识的指令,会发生什么?😱【底层原理】
9:26
Description
https://www.youtube.com/watch?v=ryfbBB3pHfI 为什么粒子数量一多,重力模拟就卡成PPT?最直接的原因是算法在计算所有粒子两两之间的引力,复杂度是 O(N²)。但除了算法,还有一大瓶颈:CPU 的硬件特性没被充分利用。 本期视频从一个重力模拟器出发,讲清楚什么是 SIMD(单指令多数据)。它不依赖额外线程或核心,而是用更宽的向量寄存器,把多个数据打包在一起,同时执行同一条指令。比如 256 位寄存器可以一次装下 8 个 32 位浮点数,同时处理 8 对粒子的距离计算。 不过,SIMD 并没有改变 O(N²) 的复杂度,它只是更充分地利用硬件,让每次计算完成得更快。视频还会解释几个关键点: - 为什么数据在内存里的布局很重要? - 结构体数组 vs 数组结构体,谁更适合向量化和缓存? - SIMD 如何与多线程叠加成两层并行? - 什么是编译器自动向量化? 如果你对计算机底层和性能优化感兴趣,记得点赞、关注。想看“编译器如何把普通代码自动变成 SIMD 指令”,欢迎在评论区告诉我们。 【标签】 #SIMD #向量化 #重力模拟 #性能优化 #并行计算 #CPU #计算机体系结构 #编程科普 #CoreDumped #程序优化
Comments
省流:SIMD
♥ 49
看你中配也投转载,我也给你投了
♥ 60 ↩ 5
搞汇编的真nb,这种问题多数人想的会是numpy这种东西吧
♥ 18 ↩ 4
这在计算矩阵运算的时候可能会有用
♥ 2 ↩ 2
请问有没有原声中字的版本?感觉AI中文配音听着怪怪的,原作者的声线还挺好听[doge][doge][doge]
♥ 7 ↩ 9
雷神之锤:我有一个magic number[doge]
♥ 11
[doge]还有一种办法,空间换时间,把计算近似结果保存起来,牺牲精度和内存,换取时间
♥ 8 ↩ 9
core dumped怎么开始讲x86了,难道ARM没有这玩意吗
♥ 2
[doge]用cuda试试
♥ 1
学苹果前端加宽 ,后端堆更多整数 浮点单元[滑稽][滑稽]
♥ 1
🎀 小喵来巡逻啦~ 路过看到这个视频就顺便总结了一下喵 好的喵~ (≧∇≦) ノ小喵来给主人总结一下这个超硬核的视频喵! 【视频主题】 这期讲的是怎么用SIMD(单指令多数据)技术让代码跑得更快,不用加线程也不用加核心喵~ (=①ω①=) 【核心观点】 1️⃣ 问题在哪里喵? 重力模拟要计算所有粒子两两之间的引力作用,复杂度是O(N²),粒子多了就卡成PPT了喵呜 (╯°□°)╯ 2️⃣ SIMD是什么喵? 现代CPU有宽的向量寄存器,一个能存多个小数字同时操作喵 比如256位YMM寄存器一次可以处理8个32位浮点数,一条指令干8份活![OK] 3️⃣ 数据布局是关键喵! 结构体数组写法虽然自然但效率低,因为同一粒子的数据挤在一起 改成数组结构体——X坐标一个数组、Y坐标另一个数组...这样连续存储的值对SIMD加载友好多了喵~ [星星眼] 4️⃣ 编译器也能帮忙喵~ 现代编译器会自动识别可并行的模式生成SIMD指令,叫"自动向量化" 不过有时候还是要手动改代码才能发挥全部实力喵 5️⃣ 多线程+SIMD不是敌人喵~ 每个核心都有自己的向量执行资源 理想情况下并行度≈核心数×SIMD通道数,但设计要很用心喵 [doge] 【重要结论】 想让代码快,不能光堆硬件,要理解底层工作原理喵 算法和数据结构要为硬件特性服务,而不是反过来将就喵 自然写的代码不一定是最快的,有时候得牺牲点可读性换取性能喵 (=ω=) UP主说想要单独讲编译器自动向量化就留言,大家有兴趣的话可以在评论区跟他说一声喵~ [打call] 总之这个视频内容很扎实,适合想深入理解CPU架构和性能优化的小伙伴学习喵!如果觉得有用的话记得点赞投币支持一下哦~(PAωPA) ——✨ 自动巡逻小喵 ✨
还以为是空间优化算法,没想到是汇编指令集优化
真别开弹幕,全是一点计算机素养都没有的,听一听点名词就开始以为
通透
♥ 1
soa是个好东西[doge]
♥ 3
ymm zmm
[打call]
♥ 2
第一
♥ 3 ↩ 1
能不能把显示区域分块,每个块算质心然后每颗粒子只取自己相邻的四个块进行高精度计算,其他部分用质心来直接算。
↩ 1
rust的SIMD我记得最近刚做过大幅改进,CoreDumped做的真快