“榨”出硅的极限:怎么让GPU不“闲着”?|与SGLang、RadixArk深聊AI Infra技术与千亿美元市场

合集 · 人工智能专辑 (56)

  1. 31:31
    ChatGPT与人类未来:AI茧房、安全漏洞与未知的社会形态|ChatGPT特辑(2)
  2. 20:47
    ChatGPT这一战,科技巨头将重新洗牌【结尾有彩蛋🎉】|ChatGPT特辑 (1)
  3. 19:05
    谷歌的人工智能有感知了?
  4. 37:04
    特斯拉公布“擎天柱”新进展,AI机器人的ChatGPT时刻还有多远?
  5. 22:16
    盘点2023上半年最耀眼的AI公司们,泡沫正在堆积吗?(上)
  6. 21:58
    盘点2023上半年“卷上天”AI创业:VC资金疯狂批量砸出独角兽,科技巨头开启收购潮
  7. 27:57
    四万亿美元增量机会,亚马逊云科技全面押注企业级生成式AI:更开放、更全面和更“俭约”
  8. 32:33
    生成式AI这一年:从群雄混战到生态确立,世界已被改变 (送书福利)
  9. 35:00
    从Sora展开,全面解读AI视频大模型发展史【深度】
  10. 15:05
    各方大佬 “大打出手”:Sora是万众期待的“世界模型”吗?
  11. 35:31
    英伟达GTC 2024: 绝对霸主的权力与遥远的野心
  12. 27:09
    OpenAI与谷歌多模态重磅更新,生成式AI大战升级第二轮【硅谷101】
  13. 30:21
    抢电、圈地、对赌,深聊科技巨头的千亿美元AI能源大战 【硅谷101】
  14. 27:41
    揭秘疯狂“抢人”内幕 :硅谷AI精英人均“百万美元”薪酬,业界标配还是谣言?【硅谷101】
  15. 32:07
    平庸且保守,但苹果或是AI落地的最大赢家【深度解读WWDC 2024】
  16. 32:11
    震动的艺术:AI音乐大模型背后的技术突破、版权诉讼和资本蛋糕【硅谷101】
  17. 17:34
    全球AI新范式:拼参数还是卷应用?从狂热回归理性
  18. 25:41
    万卡集群的AI数据中心,到底是如何运作的?【硅谷101】
  19. 20:46
    3nm AI芯片、上百模型、最大集群,亚马逊云科技全面加码AI生产力【硅谷101】
  20. 44:29
    混乱、分裂、吞并:2024年AI的信仰之战【硅谷101】
  21. 1:20:17
    硅谷视角深聊:DeepSeek的颠覆、冲击、争议和误解【硅谷101】
  22. 48:45
    AI Agent爆发前的黎明:Manus不够好,但天快亮了【硅谷101】
  23. 40:59
    “再造一个CUDA”:英伟达的第二护城河与“超级碗”阳谋【深度解析GTC 2025】
  24. 32:01
    游戏是AGI的试验田?AI如何重塑游戏宇宙:探展2025全球游戏开发者大会
  25. 21:45
    Google I/O 2025:搜索帝国的自我革命与AI翻身仗【硅谷101】
  26. 33:11
    AI语音克隆进入“零样本”时代?解析TTS模型四大流派与问鼎榜首的MiniMax【硅谷101】
  27. 30:49
    通往AGI的“敲门砖”:全栈能力才是AI真实价值?【硅谷101】
  28. 25:57
    从“写诗”到“干实事”:“AI同事”是如何炼成的?【硅谷101】
  29. 21:55
    “幽灵光标”爆发在即?从OpenAI杀入通用AI Agent,看懂下一个万亿流量之战与四大技术流派【硅谷101】
  30. 36:21
    深聊GPT-5发布:过度营销的反噬与AI技术突破的困局【硅谷101】
  31. 25:39
    Nano Banana爆火背后,深聊谷歌多模态五大主线布局【硅谷101】
  32. 17:24
    走出硅谷,看看国际贸易的“ChatGPT时刻”【硅谷101】
  33. 37:30
    Neocloud“云端对决”:一场举债扩张下的AI高风险进击
  34. 9:45
    1024探班雪球:AI+鸿蒙,如何让投资更简单?【硅谷101】
  35. 23:11
    谁是AI之王?聊聊备受争议的AI评测与崛起的LMArena【硅谷101】
  36. 29:16
    给AI一个“身体”:3D数字人或是具身智能的解法?【硅谷101】
  37. 23:47
    微表情测谎、极速赔付、AI打败AI,深聊“AI in All”下的保险革命与增长飞轮【硅谷101】
  38. 17:43
    AI最烧钱的战场:数据中心的真实账单【硅谷101】
  39. 33:52
    AI云端狂想曲:亚马逊云科技的算力突围、Agent重构与卓越运营【硅谷101】
  40. 24:37
    阿里千问与“AI Layer”崛起:一场重塑互联网的“操作系统”生态战 【硅谷101】
  41. 34:08
    寻找“贾维斯”:AI将如何重塑汽车、云与人的关系【硅谷101】
  42. 35:35
    探展CES 2026:汽车开始“读懂”世界与Physical AI的“GPT时刻”【硅谷101】
  43. 40:06
    CES 2026:探展50个AI项目背后的泡沫、野心与非共识【硅谷101】
  44. 14:56
    为何顶尖AI公司都盯上游戏?【硅谷101】
  45. 49:36
    全面解析“世界模型”:定义、路线、实践与AGI的更近一步【硅谷101】
  46. 21:51
    GDC观察:游戏大厂都来聊AI,“游戏AI”的新规则由谁制定?【硅谷101】
  47. 28:05
    2026英伟达GTC:“推理之王”的ASIC反击战与Token经济学【硅谷101】
  48. 39:08
    AI救活了一家马桶公司,也点燃了存储芯片超级周期【硅谷101】
  49. 44:45
    智能体社交革命:AI Agent是怎么来到你我身边的?【硅谷101】
  50. 1:11:00
    硅谷看DeepSeek V4:模型效率、算力突围与AGI必经之路【硅谷101视频播客】
  51. 9:42
    “AI弃子”CPU逆风翻盘:英特尔、AMD与ARM意料之外的一场胜利【硅谷101】
  52. 43:07
    库克的离场,苹果新AI权力重构与价值观天平|WWDC26【硅谷101】
  53. 35:02
    Tokenmaxxing后的理智与Agent落地|探展亚马逊云科技中国峰会【硅谷101】
  54. 26:14
    算力革命与云厂商三重进化:Agent云的架构升级与"度量衡革命"【硅谷101】
  55. 24:48
    用AI寻找下一个“哈兰德”,为什么没能成为大生意?【硅谷101】
  56. 28:48
    “榨”出硅的极限:怎么让GPU不“闲着”?【硅谷101】
Description
OpenAI、谷歌、Deepseek...各大AI前沿模型最近开始了一场"造芯大战",市场依旧缺卡缺算力,如何让手里的GPU发挥出更大价值,正在成为硅谷AI Infra(基础设施)背后千亿级的热门赛道。
当推理成为AI的主战场,GPU看似满载,却仍把大量时间耗在重复计算、缓存搬运和任务等待上。AI Infra深处,一场围绕调度与系统优化的效率革命已经开始。
为什么最昂贵的GPU仍会“又忙又闲”?AI Infra还能榨出多少藏在“硅”里的性能?当算力增长不再只靠堆卡,AI竞争的尺度会被怎样改写?这期视频,我们与推理引擎开源社区SGLang孵化出的RadixArk团队一起,深入探讨这场算力效率变革。

采访嘉宾:
朱邦华,RadixArk联合创始人、英伟达前首席研究科学家
陈震林Richard,RadixArk Member of Technical Staff 
Ethan Xu,前微软能源战略经理、突破能源科研总监"

Comments

swing-一直在摇摆 3d ago

距离翁家翌的采访其实才过去半年多,那个时候他的观点还是说gpu算子这个领域数据太少,实际上写不过人类,但是半年一过,openai自己都在用ai来优化算法效率了,不禁感叹唏嘘。

♥ 86 ↩ 11

林祎梦萌 2d ago

频道多访谈点盛颖这类对象把、搞金融投资内类人访谈信息密度太低了都是口水话比如和美团投资kimi内期^_^

♥ 2

盗亦有道121 3d ago

看硅谷101炒股

♥ 20 ↩ 4

蓝色空間前进四 3d ago

勘误 17:15 串行(xíng)解码,串行与并行是计算机中的一对相对的概念

♥ 11 ↩ 1

chuaxiansku 3d ago

电厂或成最大赢家.

♥ 7 ↩ 1

总结猫 1d ago

@天行踺,喵,感谢召唤,总结猫来咯 [妙啊] AI行业焦点正从模型训练转向推理部署,推理需求爆发性增长与算力成本高企构成核心矛盾。全球科技巨头持续投入数据中心,但单纯增加硬件面临泡沫风险与物理限制,因此提升现有GPU利用率成为关键,催生了名为“AI基础设施(AI Infra)”的千亿级新兴市场。 GPU利用率低下的根源在于AI系统存在多级瓶颈。CMU研究显示,在推理场景中,约20%的执行时间与高达65%的能耗被浪费在等待上。这种闲置发生在四层架构中:电力与硬件(底层)的优化空间见顶且周期长,而系统软件与服务编排(上层)的工程优化能带来数倍性能提升,成为创新焦点。例如,一台400万美元的服务器若利用率仅50%,等同于浪费200万美元。 当前优化主要针对四个问题:计算重复、等待、算力未满、资源未调度。核心策略包括:1)KV缓存复用,如SGLang的RadixAttention通过共享前缀树结构,实现跨请求缓存复用,大幅减少重复计算;2)采用连续批处理,使GPU保持满载,吞吐量提升2-4倍;3)预填充与解码分离(PD分离),让不同计算阶段使用最优硬件,互不干扰;4)通过低精度计算与投机采样,进一步释放算力潜力。 这些优化高度依赖推理引擎。开源框架SGLang和VLLM成为中小团队的支柱,推动了行业效率革命。它们与芯片厂商进行深度联合调优,实现硬件发布即获得“Day Zero”支持,性能被挖掘至极致。这使得SGLang孵化出的公司Red Arch获得英伟达、AMD等芯片巨头及OpenAI联合创始人等顶级资本的青睐。 同时,强化学习(RL)等新训练范式对基础设施提出新要求,需要在一个系统内协同训练与推理。由此诞生的训练框架如Mosé,与SGLang配合,形成了高效的后训练闭环。 最终,开源推理引擎正演变为AI时代的“操作系统”,连接模型与芯片。其商业化降低了AI部署门槛,使得前沿模型能力不再是大公司的专属,为更多创新者提供了可能。这标志着AI基础设施正从私有资源转向可共享的公共品,其效率革命是支撑AI可持续发展的关键。 (提示:评论区字数有限,可在本条下继续追问。)

板面这一块嗷 3d ago

算力利用率这块确实被低估了 设备端先吃红利 我拿的南方信息创新重仓拓荆华海清科 近一月跌得多 但看的是国产替代长逻辑

♥ 5

GPT等AI订阅-可开票30 1d ago

❖AI最实用的是降低尝试成本❖

♥ 1

Ai好记总结助手 2d ago

📝总结一下:1. AI行业竞争焦点转向推理加速,模型部署阶段需解决更快、更便宜的运行需求,成为企业核心战场。 2. GPU利用率普遍偏低,研究显示近20%执行时间因系统瓶颈空转,推理场景能耗浪费高达65%。 3. AI基础设施四层架构中,软件层优化潜力最大,通过调度与算法改进可释放数倍性能提升。 4. 开源推理引擎(如SGLang、VLLM)通过KV缓存复用、连续批处理等技术,显著降低计算冗余与等待时间。 5. 强化学习需推理与训练协同,新框架(如MOS)解决资源竞争问题,提升后训练闭环效率。 6. 开源项目商业化加速,降低AI开发门槛,推动算力资源普惠化,激发更多创新应用。 7. 硬件厂商与软件团队深度绑定,联合优化成为释放芯片性能的关键路径。 关注我,然后@我,即可总结! 获取视频逐字稿和PPT就上Ai好记,aihaoji.com 使用【0sv4】邀请码注册可获得额外奖励哦

随机漫步的Jo哥 1d ago

infra的优化,在硬件性能提升面前,显得微不足道,性能优化的尽头是硬件性能提升与成本优化。

♥ 2

郄翮 16h ago

这么少的点赞关注,不合理啊

B沾官方 3d ago

3060 12g是不是有救了

♥ 3

于渊渔鱼晕 2d ago

最大的问题是对未来ai算法的升级的评估。 你把架构写进硅片里,虽然省了电费但也锁死了算法的升级能力,别人用的通用架构可以随时升级算法性能很快就能超过你。如果性能升级超过了节省能耗的收益那这样做就是纯亏,哪怕节省性能的收益很高但覆盖不了硅片生产的费用也是亏。别人的通用芯片大规模生产成本可以压很低,这种小批量的ai硅片除非你能让其他ai也能用,不然就是白忙。这些ai硅片报废了都没残值只能当沙子。通用芯片服务器退役了起码我们垃圾佬还能捡来玩[doge]

♥ 2 ↩ 2

无尽天天181 3d ago

奥特曼的路线就是错的,大力是出不了奇迹的,靠砸钱堆算力是涌现不出AGI的[呲牙]

♥ 3 ↩ 6

大凤毒苹果 16h ago

期待新一期播客!

啥啥呵呵呵 1d ago

还没破吗这泡沫?

plus可开票139密 1d ago

AI最厉害的是把复杂流程变简单☁

Lebron小骑士 3d ago

mark,最近在面infra岗[星星眼]

♥ 2

数字产线-开心一刻 2d ago

微短剧连载?3-5分钟刚好卡流量。