“榨”出硅的极限:怎么让GPU不“闲着”?|与SGLang、RadixArk深聊AI Infra技术与千亿美元市场
合集 · 人工智能专辑 (56)
-
ChatGPT与人类未来:AI茧房、安全漏洞与未知的社会形态|ChatGPT特辑(2)
31:31
-
ChatGPT这一战,科技巨头将重新洗牌【结尾有彩蛋🎉】|ChatGPT特辑 (1)
20:47
-
谷歌的人工智能有感知了?
19:05
-
特斯拉公布“擎天柱”新进展,AI机器人的ChatGPT时刻还有多远?
37:04
-
盘点2023上半年最耀眼的AI公司们,泡沫正在堆积吗?(上)
22:16
-
盘点2023上半年“卷上天”AI创业:VC资金疯狂批量砸出独角兽,科技巨头开启收购潮
21:58
-
四万亿美元增量机会,亚马逊云科技全面押注企业级生成式AI:更开放、更全面和更“俭约”
27:57
-
生成式AI这一年:从群雄混战到生态确立,世界已被改变 (送书福利)
32:33
-
从Sora展开,全面解读AI视频大模型发展史【深度】
35:00
-
各方大佬 “大打出手”:Sora是万众期待的“世界模型”吗?
15:05
-
英伟达GTC 2024: 绝对霸主的权力与遥远的野心
35:31
-
OpenAI与谷歌多模态重磅更新,生成式AI大战升级第二轮【硅谷101】
27:09
-
抢电、圈地、对赌,深聊科技巨头的千亿美元AI能源大战 【硅谷101】
30:21
-
揭秘疯狂“抢人”内幕 :硅谷AI精英人均“百万美元”薪酬,业界标配还是谣言?【硅谷101】
27:41
-
平庸且保守,但苹果或是AI落地的最大赢家【深度解读WWDC 2024】
32:07
-
震动的艺术:AI音乐大模型背后的技术突破、版权诉讼和资本蛋糕【硅谷101】
32:11
-
全球AI新范式:拼参数还是卷应用?从狂热回归理性
17:34
-
万卡集群的AI数据中心,到底是如何运作的?【硅谷101】
25:41
-
3nm AI芯片、上百模型、最大集群,亚马逊云科技全面加码AI生产力【硅谷101】
20:46
-
混乱、分裂、吞并:2024年AI的信仰之战【硅谷101】
44:29
-
硅谷视角深聊:DeepSeek的颠覆、冲击、争议和误解【硅谷101】
1:20:17
-
AI Agent爆发前的黎明:Manus不够好,但天快亮了【硅谷101】
48:45
-
“再造一个CUDA”:英伟达的第二护城河与“超级碗”阳谋【深度解析GTC 2025】
40:59
-
游戏是AGI的试验田?AI如何重塑游戏宇宙:探展2025全球游戏开发者大会
32:01
-
Google I/O 2025:搜索帝国的自我革命与AI翻身仗【硅谷101】
21:45
-
AI语音克隆进入“零样本”时代?解析TTS模型四大流派与问鼎榜首的MiniMax【硅谷101】
33:11
-
通往AGI的“敲门砖”:全栈能力才是AI真实价值?【硅谷101】
30:49
-
从“写诗”到“干实事”:“AI同事”是如何炼成的?【硅谷101】
25:57
-
“幽灵光标”爆发在即?从OpenAI杀入通用AI Agent,看懂下一个万亿流量之战与四大技术流派【硅谷101】
21:55
-
深聊GPT-5发布:过度营销的反噬与AI技术突破的困局【硅谷101】
36:21
-
Nano Banana爆火背后,深聊谷歌多模态五大主线布局【硅谷101】
25:39
-
走出硅谷,看看国际贸易的“ChatGPT时刻”【硅谷101】
17:24
-
Neocloud“云端对决”:一场举债扩张下的AI高风险进击
37:30
-
1024探班雪球:AI+鸿蒙,如何让投资更简单?【硅谷101】
9:45
-
谁是AI之王?聊聊备受争议的AI评测与崛起的LMArena【硅谷101】
23:11
-
给AI一个“身体”:3D数字人或是具身智能的解法?【硅谷101】
29:16
-
微表情测谎、极速赔付、AI打败AI,深聊“AI in All”下的保险革命与增长飞轮【硅谷101】
23:47
-
AI最烧钱的战场:数据中心的真实账单【硅谷101】
17:43
-
AI云端狂想曲:亚马逊云科技的算力突围、Agent重构与卓越运营【硅谷101】
33:52
-
阿里千问与“AI Layer”崛起:一场重塑互联网的“操作系统”生态战 【硅谷101】
24:37
-
寻找“贾维斯”:AI将如何重塑汽车、云与人的关系【硅谷101】
34:08
-
探展CES 2026:汽车开始“读懂”世界与Physical AI的“GPT时刻”【硅谷101】
35:35
-
CES 2026:探展50个AI项目背后的泡沫、野心与非共识【硅谷101】
40:06
-
为何顶尖AI公司都盯上游戏?【硅谷101】
14:56
-
全面解析“世界模型”:定义、路线、实践与AGI的更近一步【硅谷101】
49:36
-
GDC观察:游戏大厂都来聊AI,“游戏AI”的新规则由谁制定?【硅谷101】
21:51
-
2026英伟达GTC:“推理之王”的ASIC反击战与Token经济学【硅谷101】
28:05
-
AI救活了一家马桶公司,也点燃了存储芯片超级周期【硅谷101】
39:08
-
智能体社交革命:AI Agent是怎么来到你我身边的?【硅谷101】
44:45
-
硅谷看DeepSeek V4:模型效率、算力突围与AGI必经之路【硅谷101视频播客】
1:11:00
-
“AI弃子”CPU逆风翻盘:英特尔、AMD与ARM意料之外的一场胜利【硅谷101】
9:42
-
库克的离场,苹果新AI权力重构与价值观天平|WWDC26【硅谷101】
43:07
-
Tokenmaxxing后的理智与Agent落地|探展亚马逊云科技中国峰会【硅谷101】
35:02
-
算力革命与云厂商三重进化:Agent云的架构升级与"度量衡革命"【硅谷101】
26:14
-
用AI寻找下一个“哈兰德”,为什么没能成为大生意?【硅谷101】
24:48
-
“榨”出硅的极限:怎么让GPU不“闲着”?【硅谷101】
28:48
Description
OpenAI、谷歌、Deepseek...各大AI前沿模型最近开始了一场"造芯大战",市场依旧缺卡缺算力,如何让手里的GPU发挥出更大价值,正在成为硅谷AI Infra(基础设施)背后千亿级的热门赛道。 当推理成为AI的主战场,GPU看似满载,却仍把大量时间耗在重复计算、缓存搬运和任务等待上。AI Infra深处,一场围绕调度与系统优化的效率革命已经开始。 为什么最昂贵的GPU仍会“又忙又闲”?AI Infra还能榨出多少藏在“硅”里的性能?当算力增长不再只靠堆卡,AI竞争的尺度会被怎样改写?这期视频,我们与推理引擎开源社区SGLang孵化出的RadixArk团队一起,深入探讨这场算力效率变革。 采访嘉宾: 朱邦华,RadixArk联合创始人、英伟达前首席研究科学家 陈震林Richard,RadixArk Member of Technical Staff Ethan Xu,前微软能源战略经理、突破能源科研总监"
Comments
距离翁家翌的采访其实才过去半年多,那个时候他的观点还是说gpu算子这个领域数据太少,实际上写不过人类,但是半年一过,openai自己都在用ai来优化算法效率了,不禁感叹唏嘘。
♥ 86 ↩ 11
频道多访谈点盛颖这类对象把、搞金融投资内类人访谈信息密度太低了都是口水话比如和美团投资kimi内期^_^
♥ 2
看硅谷101炒股
♥ 20 ↩ 4
勘误 17:15 串行(xíng)解码,串行与并行是计算机中的一对相对的概念
♥ 11 ↩ 1
电厂或成最大赢家.
♥ 7 ↩ 1
@天行踺,喵,感谢召唤,总结猫来咯 [妙啊] AI行业焦点正从模型训练转向推理部署,推理需求爆发性增长与算力成本高企构成核心矛盾。全球科技巨头持续投入数据中心,但单纯增加硬件面临泡沫风险与物理限制,因此提升现有GPU利用率成为关键,催生了名为“AI基础设施(AI Infra)”的千亿级新兴市场。 GPU利用率低下的根源在于AI系统存在多级瓶颈。CMU研究显示,在推理场景中,约20%的执行时间与高达65%的能耗被浪费在等待上。这种闲置发生在四层架构中:电力与硬件(底层)的优化空间见顶且周期长,而系统软件与服务编排(上层)的工程优化能带来数倍性能提升,成为创新焦点。例如,一台400万美元的服务器若利用率仅50%,等同于浪费200万美元。 当前优化主要针对四个问题:计算重复、等待、算力未满、资源未调度。核心策略包括:1)KV缓存复用,如SGLang的RadixAttention通过共享前缀树结构,实现跨请求缓存复用,大幅减少重复计算;2)采用连续批处理,使GPU保持满载,吞吐量提升2-4倍;3)预填充与解码分离(PD分离),让不同计算阶段使用最优硬件,互不干扰;4)通过低精度计算与投机采样,进一步释放算力潜力。 这些优化高度依赖推理引擎。开源框架SGLang和VLLM成为中小团队的支柱,推动了行业效率革命。它们与芯片厂商进行深度联合调优,实现硬件发布即获得“Day Zero”支持,性能被挖掘至极致。这使得SGLang孵化出的公司Red Arch获得英伟达、AMD等芯片巨头及OpenAI联合创始人等顶级资本的青睐。 同时,强化学习(RL)等新训练范式对基础设施提出新要求,需要在一个系统内协同训练与推理。由此诞生的训练框架如Mosé,与SGLang配合,形成了高效的后训练闭环。 最终,开源推理引擎正演变为AI时代的“操作系统”,连接模型与芯片。其商业化降低了AI部署门槛,使得前沿模型能力不再是大公司的专属,为更多创新者提供了可能。这标志着AI基础设施正从私有资源转向可共享的公共品,其效率革命是支撑AI可持续发展的关键。 (提示:评论区字数有限,可在本条下继续追问。)
算力利用率这块确实被低估了 设备端先吃红利 我拿的南方信息创新重仓拓荆华海清科 近一月跌得多 但看的是国产替代长逻辑
♥ 5
❖AI最实用的是降低尝试成本❖
♥ 1
📝总结一下:1. AI行业竞争焦点转向推理加速,模型部署阶段需解决更快、更便宜的运行需求,成为企业核心战场。 2. GPU利用率普遍偏低,研究显示近20%执行时间因系统瓶颈空转,推理场景能耗浪费高达65%。 3. AI基础设施四层架构中,软件层优化潜力最大,通过调度与算法改进可释放数倍性能提升。 4. 开源推理引擎(如SGLang、VLLM)通过KV缓存复用、连续批处理等技术,显著降低计算冗余与等待时间。 5. 强化学习需推理与训练协同,新框架(如MOS)解决资源竞争问题,提升后训练闭环效率。 6. 开源项目商业化加速,降低AI开发门槛,推动算力资源普惠化,激发更多创新应用。 7. 硬件厂商与软件团队深度绑定,联合优化成为释放芯片性能的关键路径。 关注我,然后@我,即可总结! 获取视频逐字稿和PPT就上Ai好记,aihaoji.com 使用【0sv4】邀请码注册可获得额外奖励哦
infra的优化,在硬件性能提升面前,显得微不足道,性能优化的尽头是硬件性能提升与成本优化。
♥ 2
这么少的点赞关注,不合理啊
3060 12g是不是有救了
♥ 3
最大的问题是对未来ai算法的升级的评估。 你把架构写进硅片里,虽然省了电费但也锁死了算法的升级能力,别人用的通用架构可以随时升级算法性能很快就能超过你。如果性能升级超过了节省能耗的收益那这样做就是纯亏,哪怕节省性能的收益很高但覆盖不了硅片生产的费用也是亏。别人的通用芯片大规模生产成本可以压很低,这种小批量的ai硅片除非你能让其他ai也能用,不然就是白忙。这些ai硅片报废了都没残值只能当沙子。通用芯片服务器退役了起码我们垃圾佬还能捡来玩[doge]
♥ 2 ↩ 2
奥特曼的路线就是错的,大力是出不了奇迹的,靠砸钱堆算力是涌现不出AGI的[呲牙]
♥ 3 ↩ 6
期待新一期播客!
还没破吗这泡沫?
AI最厉害的是把复杂流程变简单☁
mark,最近在面infra岗[星星眼]
♥ 2
微短剧连载?3-5分钟刚好卡流量。