作者 | 黄昱
过去两年来,具身智能如火如荼,“加速商业化”成为行业发展的一大标签。2026世界人工智能大会(WAIC)上,机器人们更是上演“十八般武艺”。
但火热表象之下,具身智能的实际能力还是与外界期待存在差距,且在落地场景及本体形态上存在同质化问题。
在WAIC期间的媒体交流会中,腾讯首席科学家、腾讯Robotics X实验室、福田实验室主任张正友对华尔街见闻等媒体表示,具身智能还在起步阶段,真正的落地比较少,所以大家都找哪一些场景能真正让具身智能发挥作用,到最后找到的场景可能都差不多。
不过,张正友认为这不一定是坏事,大家对落地要有信心。“任何行业起步的时候都有非常多企业参与进来,但是后面会大浪淘沙,所以我觉得这不会阻碍这个行业发展。”
对于机器人落地的场景,张正友多次提到看好养老场景,但他也认为养老场景是最难的。
就现在比较受关注的超仿生人形机器人而言,张正友则告诉华尔街见闻,腾讯没有涉足相关领域。在他看来,情绪价值不一定要通过超仿生的方式来提供,要从第一性的原理去思考。
早在2018年,腾讯Robotics X实验室就成立了,致力于机器人前沿技术的研究与应用。
这轮具身智能的发展虽然火热,但腾讯也始终强调自己的参与边界。2025年初,腾讯董事会主席兼首席执行官马化腾就曾表示,腾讯希望成为所有机器人厂商的合作伙伴,而不是取而代之做硬件,这和腾讯的整体战略目标一致。
也正是在此背景下,2025 WAIC期间,腾讯正式发布了具身智能开放平台Tairos“钛螺丝”,这是国内首个以模块化的方式提供大模型、开发工具和数据服务的具身智能软件平台,通过即插即用的方式面向机器人行业开放。
据悉,去一年,腾讯Robotics X 实验室已与宇树、智元、越疆、松延动力、乐聚、华沿等机器人企业以及博世、蓝思、景德镇、敦煌等场景合作伙伴,探索具身智能在不同机器人、不同产业场景中的落地。
在2026 WAIC期间,腾讯又发推出了具身智能系列新模型和智能体新成果,首次系统性地打通“感知—身体—行动”的闭环。
张正友解释道,这是沿着一道主线展开的产品,先让智能看懂物理世界,再让它想象目标状态,最后把想法变成稳定的动作——然后,把这些能力整合成持续在线、可复用的智能体。
据悉,腾讯本次发布的具身基座模型包括Hy-Embodied-VLM-1.0、Hy-Embodied-RxBrain-1.0 和 Hy-Embodied-VLA-0.5,这三个模型都基于混元大模型打造。
具体来看,VLM 模型像“右脑”,负责理解图像、空间和场景;RxBrain 模型像具身“大脑”,统一认知、规划和对未来状态的想象;VLA 模型连接“小脑”和身体,把高层目标转化成连续的、可纠错的动作。
据悉,Hy-Embodied-VLA-0.5的核心竞争力不是训练一个更大的模型,而是构建“数据—模型—训练—部署”协同发力的完整学习栈,通过亚毫米级高精度 UMI 采集系统积累超一万小时人类示教数据。
张正友指出,真正的智能,需要让语言、视觉、空间认知、身体控制和环境反馈连通起来,在“感知—身体—行动”的闭环里接受验证。
这其实也正是腾讯 Robotics X 探索具身原生智能的基本思路:从离身走向具身,从分裂的模块走向整体的闭环。
在张正友看来,今天最聪明的人工智能,本质上还是“缸中之脑”。过去几年,大模型的进展令人惊叹,但是,一旦进入真实世界,问题就来了:它未必真正理解物体的位置、空间关系和可操作性;也很难在一个持续变化的环境里,一边行动、一边接收反馈,再及时地做出调整。
“这就像是一个被养在缸里的大脑——拥有丰富的知识,却没有身体,也缺少和世界直接互动的闭环。我们把这种状态叫做‘离身智能’。”
具身智能数据稀缺是阻碍具身智能变聪明的关键因素。
张正友指出,在具身智能数字金字塔中,最下面的一层是互联网数据,上面一层是第一人称视角操作视频,第二层是带传感器手套收集的数据,最顶层则是遥操作数据。遥操作数据虽然采集效率低,但被视作用来训练机器人效果最好的数据。
此外,张正友表示,机器人训练所需数据包括网络视频、第一人称视角操作视频、带传感器手套收集的数据、遥操作数据。要让机器人经由训练变得更智能,这四类数据需要打通。
与大语言模型技术栈已经收敛到一个大家都认可的范畴不同,张正友表示,具身智能模型的技术方案尚未达成共识,去年业界兴起VLA(视觉语言动作模型)范式,今年则在在谈论世界模型,Hy-Embodied-RxBrain-1.0就是腾讯在世界理解模型上的探索。