逐篇解析机器人基座模型和VLA经典论文——“人就是最智能的VLA”

合集 · 技术之美 (7)

  1. 3:20:54
    逐篇讲解DeepSeek关键9篇论文及创新点——“勇敢者的游戏”
  2. 2:36:13
    逐篇讲解DeepSeek、Kimi、MiniMax注意力机制新论文——“硬件上的暴力美学”
  3. 2:29:42
    逐篇解析机器人基座模型和VLA经典论文——“人就是最智能的VLA”
  4. 2:33:43
    人类驯服可控核聚变还有多少路程?对能量奇点创始人杨钊3小时访谈
  5. 2:38:11
    宁德时代领投11亿!和王鹤聊:具身智能学术边缘史和资本轰炸后的人为乱象
  6. 2:20:39
    逐段讲解Kimi K2报告并对照ChatGPT Agent、Qwen3-Coder等:“系统工程的胜利”
  7. 4:22:38
    干货!开源一段论文探索之旅给大家
Description
(因为因为,陈老师真的分享了很多很多的动图和视频,本集结合视频服用效果更佳噢!——就是这里!——嘿嘿!预祝你学得开心!学得顺利啦!)

今天的嘉宾是清华大学交叉信息研究院助理教授、星动纪元创始人陈建宇。他的研究和创业方向都是人形机器人。

大语言模型浪潮爆发后,学界和工业界看见了机器人从专用走向通用的可能迹象,机器人革命随之而来。其中,本轮革命最重要的是,对机器人底层架构,也就是机器人“大脑”的探索。

但通用机器人还在科学研究阶段,处于产业发展早期。这集节目,陈老师将带领大家,概览式阅读机器人基座模型和当下最前沿的架构VLA架构(Vision-Language-Action Model,视觉语言动作模型)的经典论文。

希望我们的节目能直观地帮助更多人靠近科学前线,感受技术之美,并且能直观感知当前技术拐点。

期待2025,我们和AI共同进步!

02:30 陈建宇的研究和创业方向
17:36 当下最大变量:从专用模型到通用模型(robot foundation model)的可能性
21:12 大模型浪潮爆发后,机器人领域经历了两个阶段:从利用基础模型进行机器人研究(leveraging foundation models in robotics)到为机器人预训练基础模型(pretraining foundation models for robotics)
第一阶段:利用基础模型进行机器人研究
21:59 机器人传统三板块:Planning+Perception+Actuation(规划+感知+执行)
第一步,用LLM(Large Language Model,大语言模型)替代Planning
27:03 第二步,用VLM(Vision-Language Models,视觉语言模型)替代Perception
32:47 第三步,想把Actuation进一步自动化,用Code LM(专门用于代码相关任务的大型语言模型)来替代Actuation
第二阶段:为机器人预训练基础模型
38:36 VLA端到端模型(Vision-Language-Action Model,视觉语言动作模型)——“人是很智能的VLA Agent”
39:53 关于VLA的经典论文及分类
02:03:06 未来方向
02:09:22 最后的提问

播客节目在腾讯新闻首发,大家可以前往关注哦,这样可以第一时间获取节目信息和更多新闻资讯:)

你也可以在小宇宙、苹果Podcast、Spotify、QQ音乐、喜马拉雅找到我!

影片来源:影视飓风

Comments

小白在武大 2025-04-06

感谢小珺在本职记者工作之外 还提供了额外的技术学习视频.每一期都是精品, 这个总结类视频相当有帮助. 我个人虽然不做机器人方向,但是非常高兴能从大牛中学习一下这个方向的最新技术前沿. 不需要高产,但希望可以多请不同领域的AI专家,给大家带来不同维度不同方向的知识

♥ 66 ↩ 2

张小珺商业访谈录 2025-04-07

你的赛博组会又来了! 这是长篇技术科普第四篇,关于机器人。 这集节目,陈建宇老师将带领大家,概览式阅读机器人基座模型和当下最前沿的VLA架构的经典论文。(陈建宇的研究和创业方向都是人形机器人) “期待和你一起读论文,领略科技平权,感受技术之美。”

♥ 58

栖霞山逮虾户 2025-04-07

02:30 陈建宇的研究和创业方向 17:36 当下最大变量:从专用模型到通用模型(robot foundation model)的可能性 21:12 大模型浪潮爆发后,机器人领域经历了两个阶段:从利用基础模型进行机器人研究(leveraging foundation models in robotics)到为机器人预训练基础模型(pretraining foundation models for robotics) 第一阶段:利用基础模型进行机器人研究 21:59 机器人传统三板块:Planning+Perception+Actuation(规划+感知+执行) 第一步,用LLM(Large Language Model,大语言模型)替代Planning 27:03 第二步,用VLM(Vision-Language Models,视觉语言模型)替代Perception 32:47 第三步,想把Actuation进一步自动化,用Code LM(专门用于代码相关任务的大型语言模型)来替代Actuation 第二阶段:为机器人预训练基础模型 38:36 VLA端到端模型(Vision-Language-Action Model,视觉语言动作模型)——“人是很智能的VLA Agent” 39:53 关于VLA的经典论文及分类 02:03:06 未来方向 02:09:22 最后

♥ 42

文剑丶水又二一 2025-04-25

主持人说5年还是太乐观了。让我觉得主持人可能还真有点专业知识。 越是年轻的学生越觉得五年十年在飞速发展的科技面前肯定是日新月异的颠覆性变化。但其实我个人觉得科技的改变是阶段性的,而LLM这两年是突破了一个学术到工程的瓶颈才突然大发展,而机器人我个人觉得那个时刻还没来。所需的技术还在等待。而这个等待和研发五年十年实在太短了

♥ 37 ↩ 4

KolorTobi 2025-04-07

感谢每期都请到这么优质的嘉宾,受益匪浅

♥ 10

昨日重现001 2025-04-09

居然有人脑这么智能的AGI

♥ 7

My_universe 2025-05-03

一如既往的优质[支持] 非常感谢分享!一线研究员还是比一些砖家内容要硬核干货,收获非常大[打call]

♥ 6 ↩ 1

_木本_ 2025-04-10

PPT能分享下吗

♥ 5

我正直lz 2025-04-10

从仿生生物上寻求工程线索

♥ 4

取啥昵称比较好呢?! 2025-04-26

课件可以分享吗[蹲蹲]

♥ 3

--西北偏北 2026-05-07

居然一年前的视频现在有11个人一起看[星星眼]

♥ 2

CeciliaCHxy 2026-02-20

要是有字幕就好了,多好的采访呀!!

♥ 1 ↩ 1

大太空暴猪 2026-03-05

科幻畅想 面向通用型人形机器人的神经形态-LLM混合大脑 一、愿景:从“行走的电脑”到“具身化的生命” 目前的人形机器人(例如 Tesla Optimus、Unitree G1)存在 “神经差距”:高级推理(LLM)和低级反应(PID/MPC)脱节,导致高延迟和巨大的功耗。 Highland-Link (H-Link) 1.0 是一个开源硬件/软件框架,旨在通过 双脑异构互连来弥合这一差距,专门用于全天候农村养老和自主农业。 二、硬件堆栈:“Highland Heart-86”主板 1. 大脑皮层(认知脑):86B LLM ASIC(CIM阵列) • 核心:强化型 BitNet b1.58 (1.5 位量化)Transformer ASIC。 • 架构:4芯片 内存计算(CIM)。参数物理存储在 堆叠在逻辑芯片顶部的RRAM 层中。 • 能力:86B 模型零延迟推理;45W-80W TDP;4000 TFLOPS(FP8 等效)。 1. 小脑(反射脑):脉冲神经网络(SNN)NPU • 功能:异步、基于事件的物理控制。 • 延迟:亚毫秒级(<1ms)扭矩反馈回路。 • 神经形态结构:用于800 万以上脉冲神经元的 8 芯片并行阵列 。 1. Synapse:Highland-Link 1.0 互连(H-Link) • 协议:基于 CXL 3.1 Fabric。 • 内存一致性:86B 和 SNN 之间零拷贝数据共享。 • 转换器:ASIC 加固的 TTFS(首次脉冲时间)编码器。在<0.5μs内将 1024 维 LLM 嵌入转换为原始脉冲序列 。

♥ 1

清华黑枪神CS2 2025-05-03

希望对我研究LLM和推荐系统的结合有启发

♥ 1

eclctum 2025-04-18

可以给个ppt链接嘛

♥ 1

herberttaaa 2025-04-26

关键是人形机器人就是个歧途 模拟人也太蠢了

♥ 1 ↩ 1

ronan2018 2025-04-15

内容太高质量了

♥ 1

小菁家的小刘 13d ago

@AI视频小助理 帮我梳理视频时间线,给出可跳转的每篇论文时间点

秋风抚残叶 2026-07-22

@豆包,帮我整理成文字信息

上帝之手dkn 2026-06-20

@有趣的程序员 总结