和蚂蚁灵波沈宇军聊:机器人原生基础模型、大脑和本体的关系、预训练与数据scale up、老师汤晓鸥

Description
进入2026年,中国科技业萌生了一个新现象:出现一批从机器人大脑出发的公司,现阶段重心不在本体上。这个现象是反直觉的——过去,大家认为,硅谷机器人团队更专注大脑研究,中国机器人团队更专注硬件和本体。

在我们上集节目中,我访谈了Physical Intelligence(Pi)研究科学家柯丽一鸣。Pi是一家在硅谷做机器人大脑的备受瞩目的实验室。业内人士把它们比作机器人的OpenAI。

今天我邀请的是一位在本土探索原生具身基模的公司,是由蚂蚁集团孵化的子公司蚂蚁灵波,目前刚发布第二代具身基础模型。

我与首席科学家沈宇军聊了聊,如何从预训练开始训一个机器人模型?瓶颈是什么?机器人的GPT-1 moment在哪里?——大家也能从中感受一些中美思路的融合与差异。

接下来,就是我对沈宇军的访谈。

OUTLINE:

00:02:03 蚂蚁灵波的缘起
人工智能学生的一段迷茫与辗转
从字节跳动到蚂蚁研究院
蚂蚁成立子公司蚂蚁灵波做具身智能始末

00:16:03 做机器人的原生大脑
为什么决定从大脑开始?
通用意味着跨本体、跨场景、跨任务
24年底成立以后,25年、26年bet了什么?
25年:从真实传感器出发解决问题
26年:既然没办法push数字世界修改模型,基于物理世界的需求重做一遍
预训练准备数据核心是:1、你要下发什么样的任务,2、拿到数据以后怎么处理更干净
这次发布的6个模型和他们的关系(Depth、Vision、VLA、Video、World、VA 2.0)
但更本质的智能我们还没解决:把和人的交互考虑进去
做具身大脑之后,处理位置随机问题的能力强了很多
机器人泛化性的迹象到底出现了吗?

01:07:29 数据没有scale up是最大卡点
具身智能还没有到GPT-1时刻,因为没有看到比较好的做数据scale up的方式
当具身数据和互联网数据能达到相同量级,可能才到GPT-1时刻,我预计明年中
发完第一代模型我们就意识到,强行在数字模型上魔改不work
硅谷两家机器人大脑公司 :Physical Intelligence强调zero shot,Generalist强调后训练
随着灵巧手的成熟,真机遥操作和UMI(Universal Manipulation Interface,通用操作接口)
两条数据采集路线可能变化
细数2024-2026年具身智能全行业的发展与速度
行业发展不及预期的仍是数据,需要百万小时起步的数据量

01:23:10 机器人大脑与本体的关系
为什么不做本体?本体很难通用,如果场景选不准,本体设计有问题
现在大脑的开发落后于本体,未来大脑和本体一定交替上升
这一代的硬件不一定能够迭代去适应下一代的模型,尤其是传感器
接下来的几代机器人基座模型会如何迭代?

01:31:48 创业是赌出来的、与蚂蚁的关系、汤晓鸥
下过的“赌注”?
蚂蚁如何管理蚂蚁灵波?
最好的预期和最坏的预期?
最终的产业格局?也许贴近大语言模型的格局
你对人形机器人有执念吗? 没有!
当下的核心任务只有一个:智能不够!
我的老师汤晓鸥

LINKS:
如果你想服用文字版,请搜索我们工作室的公众号:语言即世界language is world。

DISCLAIMER: 本内容不作为投资建议。
CONTACT: xiaojunzhang@lisw.ai
Jump into the new world-and explore with us!😉

Comments

MarkHE1222 2026-07-22

看来看去,还是姚顺雨那期最影响深刻

♥ 95 ↩ 9

哆啦A梦一Doraemon 2026-07-22

具身智能的矛盾:本体进步很快但真正卡住落地的还是智能和数据。 灵波押注“具身原生”有一定道理。视频生成在意画质,机器人更在意因果关系、实时反应和动作结果,直接拿数字世界模型改装,确实容易水土不服。不过架构针对物理世界重新设计,不代表已经解决了通用智能。现在展示出的能力更多是位置变化、环境扰动和闭环控制,距离陌生任务泛化还有很长一段路。 只做大脑的路线很聪明,也有风险。本体厂拥有最直接的数据,模型又会反过来定义相机、触觉和控制接口。公司可以分开,技术闭环很难真正分开。机器人模型会不会逐渐摆脱“多模态模型加动作头”的思路,形成自己的预训练体系?现在可以说方向值得看,远没到路线胜负已分的时候。

♥ 27

minkewu 2026-07-22

音画暂时不同步

♥ 10 ↩ 1

绿萝菲菲 2026-07-22

只做大脑有种不想做本体脏活累活的感觉,只挑好做的做[吃瓜]

♥ 5 ↩ 3

foc爱好者 2026-07-22

数据根本不重要,重要的是你对智能的理解,对数据的处理方式,对数据的存储方式,以及对数据的查询方式。这里边更多的是哲学思考。

♥ 8 ↩ 5

bili_31821115382 2026-07-23

中国有一大批优秀年轻人

♥ 3

kiinlpet 2026-07-22

香港中文大学和清华大学,中国人工智能界最厉害的两所学校啊

♥ 3 ↩ 2

维尔ZT 2026-07-22

这个简介不是用Deepseek写的吧

♥ 3 ↩ 2

抓拍小法师 2026-07-22

第一第一

♥ 3

叶愿随风 2026-07-22

最近一直在复现 lingbot [呲牙][呲牙][呲牙]这个访谈来的太及时了

♥ 2

风雪又一年灬 2026-07-22

前4分钟有音画不同步的现象

♥ 2

小年纪大红包 2026-07-22

非常热衷于收听小珺的节目

♥ 2

503831663 2026-07-23

每一期访谈都在追,提高了自己的认知。访谈的节目更新挺快的,质量也很高,主持人够专业,问题挖的很有营养。支持[笑哭]

♥ 2

Mwing_QY 2026-07-22

质量太高了,感谢[抱拳]

♥ 2

bobo的哲学梦 25d ago

50年内实现就烧高香了

♥ 1

清爽的乌云 1d ago

评论啥情况,这一期我倒觉得聊的内容非常好,事实上目前具身智能硬件层面发展很快,但模型层面相比之下瓶颈更多,愿意做开源模型对行业时间好事,特别是直接从传感器和视频来识别

♥ 1

kxgvv 2026-07-27

…差点意思…

♥ 1

淄博超霸 2026-07-22

好好好,又有视频下饭了!!!!!

♥ 1

蓝色前线 28d ago

三连走起!好棒啊。大爱小珺同学的采访,深刻、专业又不会去抢嘉宾的光芒,真的好厉害。第一次看蚂蚁灵波的采访,沈同学这么年轻,真厉害。学到了很多。

♥ 1

doodoogao 2026-07-24

当前具生智能的所有工作都是基于AGI短期无法实现的假设。如果LLM能在两年内实现自我迭代,那现在聚生智能的工作都是浪费时间。所以,这其实是对相反是两条路线的押注

♥ 1