AMD自研架构换掉CUDA: 美国Frontier超算如何承上启下, 成为最强最高效的超算?
合集 · 芯片技术 (37)
-
M1 Pro|Max 性能分析: 拳打i9, 脚踢3080?
8:43
-
【芯观察】M1 Ultra GPU TLB 翻车? 内存子系统深度科普
4:52
-
【M1 Ultra】 大了又大的芯片, 背后到底用了什么技术?
12:26
-
【堆料之王】Apple A15 全面解析: 系统缓存规模赶超6600XT
6:35
-
14nm芯片叠加能超车7nm? 全自研28nm已经量产? 都是胡扯
7:22
-
APU核显交火再现?CCD胶水故技重施?锐龙6000前瞻: 6nm Chiplets 加持, 16核秒Intel,核显追1650,交火秒3050
8:12
-
【芯观察】ARM 要断气了?生态带头者要何去何从?
10:49
-
【芯知识】英特尔12代小核提升不了续航?深入大小核架构与调度
7:49
-
全新RDNA3架构要来了,6000系列值不值得上? AMD路线图+架构深度分析
8:03
-
极客湾芯片能效测试方法不对, 还用错了算数平均? 聊聊能效分析背后的知识
12:38
-
苹果没告诉你的秘密: M1芯片背后的PMIC, 在能效上发挥了什么作用?
11:54
-
AMD自研架构换掉CUDA: 美国Frontier超算如何承上启下, 成为最强最高效的超算?
10:34
-
【M2深度分析】牙膏挤得不多不少, 也是种技术 | MBA 配置解析
10:23
-
【多大才够用?】内存深度科普: 从堆内存到虚拟内存管理
6:24
-
极客湾又错了? M2功耗测试软件解析, 顺带再聊聊数据处理问题
5:25
-
为啥安卓比iOS更吃内存? 从二进制/JVM到App框架设计全面分析
9:00
-
RDNA3架构解析: 优秀的成本控制, 全面跟进的图形技术
4:37
-
四倍性能提升, 追赶PS4/SD? 次世代Switch Orin芯片分析
10:02
-
高通联发科真的超越A16了?聊聊性能量化分析方法, 以及跑分和真实体验的关联
9:26
-
SD能连Switch游戏都能玩? 图形API发展/转译技术大科普
8:52
-
手机平板芯片那么强了, 为何除了原神没有3A大作?
12:24
-
叠了缓存, 但没都叠, 这咋调度? AMD 7950X3D 深度解析
8:01
-
一年提升15-40%性能是什么体验? M2 Pro|Max 分析
5:45
-
N3E青春版是3nm正统? N3B又是啥? 台积电3nm工艺x苹果芯片路线图分析
4:29
-
什么显卡能让ChatGPT跑在本地? 计算卡语言模型性能需求分析
7:23
-
锐评跑分软件Geekbench6: 不伦不类, 货不对板
4:00
-
财报大亏损,服务器大翻车, 还被批评出货「半破坏市场」? 深度解读Intel22财报&研发
8:03
-
拯救信号差,告别双层主板?苹果自研5G基带深度分析
12:11
-
M1大量SWAP+内存压缩还不卡,pSLC让SSD更耐用? 苹果存储协处理器&内存压缩交换机制深度解析
20:22
-
OPPO哲库为何光速解散?深度分析自研芯片失败症结
11:49
-
内存能差两三倍? 两大平台/海内外App内存占用实测
3:05
-
A17 Pro性能前瞻分析: IPC没变? 全靠提频?
14:54
-
M3系列深度解析: 新智能缓存/光追架构, 生产力爆发?
8:58
-
为什么「统一内存」是PC的未来? 从内存技术的瓶颈、芯片封装和HSA软件架构来分析
17:40
-
美术榨干光追性能, 本世代最强实机画质: GTA6首发预告分析, PC显存危机?
14:02
-
Apple R1深度解析: 不止是「信号处理器」
13:46
-
安卓多两倍,推送服务少不了: 双平台/海内外内存占用大横评
15:31
Description
最近很多年来 Nvidia GPU 的 CUDA 框架统治了包括通用计算、机器学习和创意媒体等场景. 继苹果的 Metal 向创意媒体发起挑战后, AMD 开始借助 Zen 和 GCN 演进的 CNDA 架构进攻数据中心和HPC超算市场. 这套架构优秀在什么地方? 我们今天就来揭秘.
Comments
让美国害怕的不是中国超算发展到了什么程度,而是中国不再参与美国主导的排名 如果中国带头退各种美国主导的排名,美国主导的标准,形成一股另起炉灶的风气,这个才是美国最担心的
♥ 658 ↩ 186
感觉全b站能完全看懂这期节目并跟着互动的人应该不超过100人……
♥ 318 ↩ 36
牛逼,终于有能替代cuda的环境了
♥ 265 ↩ 11
我说实话,我没听懂[囧]
♥ 147 ↩ 6
1、关于国产E级超算,我一直没注意到国内开发厂家,有宣传过自己的总线技术,内存访问技术等等计算单元之外的技术发布(类似 CLX 这种复用电器电路的也没有)。所以我怀疑,是不是现在 E 级难产,是因为带宽完全跟不上,这部分大家都没有做。单个节点自己的性能需求本身就满足不了。 2、提升效率版的 M2000 ,感觉肯定有地方上了新技术,但是因为其他瓶颈,所以反而因为技术不匹配而无法提供性能提升。所以,是不是正好就是总线部分?改进了总线,但是技术瓶颈,效率提升性能降低。 3、现在超算需要的高性能计算,我真觉得申威这条路很值得走。神威的 26010 是每部分 8x8 个 SPU ,一次 8 个同时工作类似 SIMD 。能不能改进一下结构降低开发的复杂度? 4、显卡是特意砍了 FP64 来防止“乱用”……嗯,也可以说这是为玩家省钱……
♥ 139 ↩ 11
忍不住说一下: 1.在游戏应用中,我们也会大量的使用计算流水线,而且趋势是越来越多,甚至有激进的人认为未来图形流水线不会再存在。 2.GPGPU简称是General-purpose computing on graphics processing units。本质因为GPU里面随着计算量的增多,计算流水线越来越强大,所以GPU不但可以用在游戏上,还可以用在AI等需要大量并行计算的场景。这些应用据我了解基本上都只是使用GPU里面的计算流水线,和图形流水线没半毛钱关系。所以MI系列这种脱胎于GPU的芯片也是能叫GPGPU的,他比老的架构在计算方面更加新进。
♥ 131
为什么不把通用计算模块继承到CPU上?gpu只保留光栅和光追能力?
♥ 97 ↩ 16
啥时候能真正用到国产的电脑啊 现在又贵性能又低[无语][无语]
♥ 40 ↩ 64
国产登榜首“中看不中用,业内人士都说花架子,落后技术,美国都不稀得玩”别人登榜首“承认自己落后有这么难吗?”
♥ 27 ↩ 1
我宣布我退出世界首富评选
♥ 24 ↩ 3
只能说超算又回到科技第一梯队了,我们还得努力把超算再拉回不入流的级别呀
♥ 24 ↩ 5
amdyes!
♥ 18
超算的事没什么好说的也没有好争论,认为有就有,没有就没有,没公开信息供大家论证,反正我只知道以前参与国际应用竞赛的人不少,科研人员肯定是有[哈欠][哈欠] 制裁前他们都很愿意交流学习竞争,制裁后只是不争,学习交流肯定还是有,不相关的就让它臆想,反正默默无闻埋头苦干又不是第一次[哈欠][哈欠]
♥ 16
关于UP主的第一个疑问,查了些资料,Matrix2000 和 matrix 2000+ 的架构差异比较大,所以主频提升了挺多,整体FLOPS 反而下降了一些: * Matrix2000 有点儿像 Xeon Phi,主频低,核心数多(128),并通过向量化和特殊运算指令来获取高 FLOPS(16FLOPS/cycle) ,但这种架构实际程序很难获取高性能,其他地方很容易产生瓶颈; * Matrix2000+ 采用 ARM v8 架构,核心数不变(128),虽然整体峰值性能略有下降(单核心单时钟周期的计算能力有所下降【猜测】),但整体能效比和可编程性都提高了很多。 不过暂时没找到 2000+ 比较直接的说明,有熟悉ARM v8 的小伙伴可以帮确认一下 【1】 https://www.hpcwire.com/2017/09/25/chinas-tianhe-2a-will-use-proprietary-accelerator-boast-94-petaflops-peak 【2】 https://jcst.ict.ac.cn/fileup/1000-9000/PDF/2021-1-3-0741.pdf
♥ 16
不对啊,超算不是纯粹的浪费电嘛
♥ 13 ↩ 15
省流: 咱们家的超算任重而道远 AMD有望重回民用生产力的赛道
♥ 12
同学去了俄亥俄州立的高性能计算组,原来太湖之光的架构都是买他们组的,自研简直是笑话
♥ 11 ↩ 8
超算又变成高端技术啦
♥ 11 ↩ 6
希望AMD在机器学习领域做起来啊
♥ 10