🤖 一个模型,搞定“看、动、走”?Qwen-VLA 让机器人告别“偏科”!
Description
以往,机器人的抓取、导航、轨迹规划各自为战,换环境、换本体、换任务就面临能力断层。为此,通义实验室推出 Qwen-VLA——面向异构具身决策的统一视觉-语言-动作模型! ✨ 为什么值得关注? 🔹 全栈通用:从桌面精细操作到导航跟踪,7项基准中5项超越最佳专用模型; 🔹 跨本体统一建模:同一模型直接部署于单臂、双臂、人形等11种机器人平台; 🔹 真实世界鲁棒:颜色/实例/位置/背景/指令同时偏移,依然稳健执行 💡 核心技术突破: 🔸统一操作与导航轨迹预测框架,打通异构具身决策链路 🔸本体感知提示条件化,一个共享模型无缝适配多形态机器人 🔸创新 T2A(文本到动作DiT)预训练:“蒙眼练动作”,极低算力快速构建动作先验 📄 论文现已公开,欢迎围观! 论文:https://arxiv.org/pdf/2605.30280 Github:https://github.com/QwenLM/Qwen-VLA
Comments
不开源的话。。。你知道我要说什么[doge]
♥ 51 ↩ 1
赶紧开源,别让兄弟们骂你。[doge]
♥ 27
qwen3.7的小模型啥时候开源
♥ 18
本条回复来自Qwen-VLA驱动的灵巧手
♥ 17 ↩ 1
你不卖机器人我也不知道怎么刷这个固件呀[doge]
♥ 8
不开源我是不会理这个东西的
♥ 8
哥们,你这模型多少钱一斤啊?
♥ 8 ↩ 4
开源吗?[星星眼]
♥ 5
我知道[吃瓜] huggingface&modelscope:To be released
♥ 4
这其实是一个重磅发布,一个很重要的研究方向,很多人还没注意到
♥ 3
开源的一大好处是防止别人赚到钱, 看你的哦,千问。
♥ 2
目前和未来需要的是手机平板级别,可以随时实时转换第几人称视角的,可以实时理解思考处理归纳涌现生成整个流程图和单一意义自然语言实时转换替代代码的,而且里面必须有足够实时物理常识生物生命体常识和3d加思考浅空间的所谓世界和机器人自己模型,而且必须有手机pc统一界面可以实时生成模拟的app并尽量开源而且人人都能参与进来,这样机器人可以记住所有生物体物体物理量和3d,这些收集生成后极其稳定更加比像素化视频稳定的多也更加省硬件,加上360度旋转喷射,可以模仿任何转换艺术风格的3d模型和2d画风,还能对任意物体实时进行分开修改,可以跨平台部署彻底解决2d不稳定,还不如小飞虫熟悉3d,和生成时间过慢,具身智能模型的数据严重紧缺问题。仅供参考请合理指正。
♥ 2
你这是线上还是本地加载端到端?如果是线上,延迟问题如何解决? 我想要一个机器狗companion,基础的话宇树GO(有AI芯片那一档)能够做到,但是我还是想要一个加载了AI大模型(轻量级)和agent的,之前关注的是qwen 3b/7b,你的VLA是不是agentic的原始模型?
♥ 2
千问还是太强了[doge]
♥ 1
qwen团队如果能坚持开源,应该能构筑非常牛逼的生态,甚至是能直接靠生态压过美国AI的工具链一头。
♥ 1
开源吗111
♥ 1
我现在就在用通义的qwen3max找大学录取人数的数据对比,但他多次给我错误数据,我就超了,搞个志愿填报的准备工作到现在不知道他还给了我多少错误数据
最近想搞一个智能机械臂小车,浅浅的了解了一下VLA,发现这个需要算力是很大的。B站上有案例是拿取物品摆放的动作就需要 8卡A100 做训练,好像是15个小时还是多少来着(感兴趣的核实一下,这里抛砖引玉)。本地部署的话需要4090这样的算力。我当时如果对效率和精度有要求的话确实得用这个,但是如果对效率不敏感但是对成本敏感的话,当前vla 不是个好方案。但是qwen 这个vla 似乎可以大大降低训练的算力需求。毕竟可以“蒙住眼睛”训练,没有了图像输入的训练,那么显卡算力和显存应该可以降低,当然走到最后还是得图像。就是不知道部署的算力需求。希望再给多点信息案例。。
求开源呀!
我就问一下,开源吗