🤖 一个模型,搞定“看、动、走”?Qwen-VLA 让机器人告别“偏科”!
Description
以往,机器人的抓取、导航、轨迹规划各自为战,换环境、换本体、换任务就面临能力断层。为此,通义实验室推出 Qwen-VLA——面向异构具身决策的统一视觉-语言-动作模型! ✨ 为什么值得关注? 🔹 全栈通用:从桌面精细操作到导航跟踪,7项基准中5项超越最佳专用模型; 🔹 跨本体统一建模:同一模型直接部署于单臂、双臂、人形等11种机器人平台; 🔹 真实世界鲁棒:颜色/实例/位置/背景/指令同时偏移,依然稳健执行 💡 核心技术突破: 🔸统一操作与导航轨迹预测框架,打通异构具身决策链路 🔸本体感知提示条件化,一个共享模型无缝适配多形态机器人 🔸创新 T2A(文本到动作DiT)预训练:“蒙眼练动作”,极低算力快速构建动作先验 📄 论文现已公开,欢迎围观! 论文:https://arxiv.org/pdf/2605.30280 Github:https://github.com/QwenLM/Qwen-VLA