Description
➤ 没人喜欢等待。
模型越强,推理加速就越重要。
这一期,我们聊「推理加速」。
本周「十字路口」的嘉宾是生数科技的张金涛。月初,他带队发布了 Vidu S1——一个实时交互视频模型:上传一张照片,无论是人物、动漫角色,还是一只宠物,都能变成一个可以和你实时视频通话的 AI 角色。
Vidu S1 很快,快到生成速度超过播放速度,并且支持无限时长。这是怎么做到的?
金涛在播客中分享了自己这几年一条清晰的技术主线:从 SageAttention(GitHub 3.5K 星标)、TurboDiffusion(GitHub 3.6K 星标),到 TurboServe——一整套系统级方案,为 S1 实时交互提供底层支撑。
此外,金涛也分享了他对整个 AI「推理加速」领域的观察和判断。
其实这期有意思的,不只是技术。
金涛今年 26 岁,还是清华在读博士。真正把他带进「推理加速」的,是一个很朴素的判断——当大家都默认 FlashAttention 已经把 Attention 算子做到极致时,他却发现:显卡上明明还有更快的计算单元没被用起来 ——「这么明显的收益,为什么没人做?」
所以这期节目,你也可以把它当成一份「年轻研究者样本」来听:在变化极快的 AI 领域,怎么找到自己的方向、怎么判断什么才是「最正确的事」,又怎么把它一路做到最前沿。
Comments
📝总结一下:1. 流式视频生成模型的核心是实时交互,需同时满足高分辨率(540P)、高帧率(25-42fps)和长时间不断流不崩坏,这要求推理速度必须大于播放速度,且不能仅靠加速,还需在模型架构和噪声控制上做本质创新。 2. 推理加速是多层次系统工程:从底层算子优化(如CATTENTION低比特加速)到模型层计算复杂度降低(步数蒸馏、稀疏attention),再到集群部署与请求调度,缺一不可。 3. CATTENTION已成为行业标准,被NVIDIA、AMD、华为等硬件厂商及字节、腾讯、Google等多家AI公司采用,证明了低比特加速attention的普适价值。 4. 中国视频生成模型反超美国的核心原因在于:数据质量与构造方式更优,且国内对离线视觉娱乐(如抖音、直播)的要求更高,积累了更多高质量数据,驱动了技术迭代。 5. 创业热潮合理但非人人适合,成功需要综合素质:技术洞察、团队管理、跨部门协调与本质思考能力,单纯学术成就不能保证创业成功。 6. 未来推理加速的突破方向:更底层(专用芯片设计,针对特定模型类调整计算/存储比例)和更上层(算法级复杂度降低,如稀疏计算、模型蒸馏),软硬件协同设计是必然趋势。 7. 个人成长的关键:享受将复杂问题讲清楚的能力、对底层实现细节的执着、以及导师的认知与资源支持,这些是产出世界领先工作的基础。 关注我,然后@我,即可总结! 获取视频逐字稿和PPT就上Ai好记,aihaoji.com 使用【0sv4】邀请码注册可获得额外奖励哦
♥ 1
很强,把复杂的事情,讲的很直白,而且通俗
♥ 1
试用了一下 感觉是few shot 拼接出来的
钱包在动了 不得不说
感觉不仅要在模型能力上跟字节这种传统大厂直接竞争,而且应用范围相当有限啊,考虑研究更前沿的东西吗
SA大佬