🤖 一个模型,搞定“看、动、走”?Qwen-VLA 让机器人告别“偏科”!

Description
以往,机器人的抓取、导航、轨迹规划各自为战,换环境、换本体、换任务就面临能力断层。为此,通义实验室推出 Qwen-VLA——面向异构具身决策的统一视觉-语言-动作模型!


✨ 为什么值得关注?


🔹 全栈通用:从桌面精细操作到导航跟踪,7项基准中5项超越最佳专用模型;


🔹 跨本体统一建模:同一模型直接部署于单臂、双臂、人形等11种机器人平台;


🔹 真实世界鲁棒:颜色/实例/位置/背景/指令同时偏移,依然稳健执行


💡 核心技术突破:


🔸统一操作与导航轨迹预测框架,打通异构具身决策链路


🔸本体感知提示条件化,一个共享模型无缝适配多形态机器人


🔸创新 T2A(文本到动作DiT)预训练:“蒙眼练动作”,极低算力快速构建动作先验


📄 论文现已公开,欢迎围观!


论文:https://arxiv.org/pdf/2605.30280

Github:https://github.com/QwenLM/Qwen-VLA