具身智能“卖水人”:物理AI数据基建站上风口
2027—2028年或现“机器人ChatGPT时刻”
观众在WAIC体验MEgo Gripper 与MEgo View,实现宏观环境感知与微观手部操作数据的精准同步采集
当大模型已经在语言、数学、代码等数字世界发展如火如荼时,下一阶段的关注点便转移到了物理的真实世界:机器人如何感知环境、理解任务、执行动作?如何在持续碰壁中反馈与自我进化?
这成为本届WAIC上与会专家和企业讨论的热门议题目前,除了觅蜂科技从智元体系独立出来主营具身智能、物理AI数据业务以外,国内布局这一赛道的还包括鹿明机器人、灵初智能等初创公司,以及蚂蚁旗下灵波科技、京东JoyEgoCam团队等。
智元合伙人、觅蜂科技董事长兼CEO姚卯青接受21世纪经济报道记者采访时认为,物理智能要实现规模化,必须突破三道墙:一是数据墙,真实交互数据极其稀缺且获取成本高;二是表征墙,跨任务、跨场景、跨本体的统一物理表征尚未形成;三是闭环墙,真实试错代价昂贵、反馈缓慢,难以规模化。
总体来说,模型决定起点,数据定义终局。在物理AI世界,除了无本体采集技术,还需要叠加硬件、引擎与场景,这些要素缺一不可。因此,对入局者来说,人人都有机会,机器人的ChatGPT时刻还远未到来,达成这一目标到底需要多少数据?
数据竞赛开启
7月19日,2026世界人工智能大会期间,智启具身论坛汇聚了清华大学、Physical Intelligence、Genesis AI、Dyna Robotics、Sunday Robotics、腾讯Robotics X等海内外顶尖力量,共同探讨未来发展路径。其中,任至意、王尊玄、马也骋、徐丹飞、赵子豪五位华人青年科学家和创业者,罕见在国内集体同台。
他们践行的并非同一条技术路线,却回答了当前最核心的问题:机器人的数据从哪里来?模型如何实现泛化?失败如何被转化为经验?机器人怎样长期稳定干活?
姚卯青认为,理解物理AI,首先要回到智能的两条主线:表征与闭环。表征,是对世界的抽象压缩;闭环,是智能体与环境之间持续发生的“感知、理解、决策、行动、反馈”循环。数字AI的成功,本质上是知识表征在数字环境中的成功;而物理AI的难点在于,它必须同时打通经验表征与真实世界闭环。
更加直白地说,未来的机器人要从“能演示”走向“能干活”,关键不在于单点模型能力,而在于能否形成可泛化、可优化、可进化的通用具身智能系统。毕竟,机器人不能一直只是唱歌、跳舞、打拳击。
一个核心共识正在形成:物理AI的智能涌现,不会来自单一模型或单一数据源,而取决于数据规模、模型架构、仿真评测与真机反馈共同构成的持续进化飞轮。
由此看来,物理AI的竞争不仅是模型能力之争,更是数据生产、数据治理和闭环效率的竞争。
值得关注的还有云边端协同架构。据姚卯青介绍,端侧机器人负责与物理世界交互获取数据,边缘侧进行推理与模型权重下发,云侧则负责核心的异步模型训练。目前端侧已使用国产算力平台,但在向几百亿参数的MoE架构推进过程中,国内外在算力、显存和通信带宽上仍存在瓶颈。
单一模仿到世界建模
如果说数据飞轮是物理AI的燃料,那么模型架构和训练范式则决定了燃料的利用效率。
论坛上,多位嘉宾从不同角度阐述了通向通用化的技术路径,尽管路线选择各有侧重,但一个共同方向逐渐清晰:从“看得更多、模仿得更像”升级为“理解世界、预测后果、持续进化”。
清华大学计算机系副研究员苏航将这一转变,概括为预训练范式的根本性演化。“具身智能正在从面向单一机器人和特定任务的行为模仿,转向面向开放世界的通用能力预训练。”
苏航指出,未来具身基座模型的目标不再只是学习“看到什么、如何动作”,而是形成对环境状态、物理规律、动作后果和任务进程的统一理解。
苏航认为,这一范式将沿三条主线加速演进:数据从单一本体走向多源混合,模型从行为模仿走向世界建模,学习从离线训练走向真实部署中的持续进化。“未来行业竞争的重点,将从单项任务成功率和演示效果,转向基座模型的通用性、迁移性和持续学习能力。”
Physical Intelligence研究科学家任至意则用最新模型π0.7,验证了跨本体泛化的可行性。他展示了一个引人注目的案例:仅在ARX机械臂上训练的衣物折叠能力,可以零适配迁移至UR5双臂机器人完成同类精细操作,无需针对新本体重新微调。
“多元真实交互数据是通用智能的核心驱动力。”任至意表示,最新模型已能处理橱柜整理、卧室收纳、流体容器操作等长尾场景。当前更关注通用策略模型能力的涌现,因此优先使用相对简单、维护成本较低的机器人本体。总体来看,在行业内,软硬件垂直整合优势更大,未来不排除布局硬件具身智能的可能性。
Genesis AI联合创始人王尊玄关注的则是灵巧操作这一更前沿的命题。他分享了一个方法:以1:1人类手部数据策略为基础,结合Genesis World仿真环境、多模态大模型GENE与部署数据飞轮,推动机器人在数据、仿真、模型和真实部署之间持续迭代。“通用灵巧操作的突破不只是模型架构问题,更依赖高质量数据的规模化供给。”
他指出,通过接近人类尺度的机器人手与非侵入式手套数据采集方式,Genesis AI正在缩小人手与机器人手之间的数据鸿沟。
当机器人从实验室走向产业场景,可靠性成为更紧迫的考验。
Dyna Robotics联合创始人兼首席科学家马也骋分享了一个相对成功的案例:DYNA-1商用基座模型在餐巾折叠这一高难度任务中,成功率达99.4%,能在24小时无人干预下,自主折叠超过850条餐巾。“我们构建了预训练数据金字塔,已积累超20万小时预训练数据。”
目标是“亿小时”
数据,成为关键变量。
与主要研发机器人本体或基础模型的公司不同,觅蜂科技打造的是数据基础设施层。其核心任务不是替代某一种模型路线,而是围绕数据采集、治理、评测和部署回流,连接机器人公司、模型团队、数据服务商与真实应用场景。
据姚卯青介绍,觅蜂科技计划在2026年实现千万小时级数据产能。“无本体采集可以更低成本、更便捷地进入真实作业流程,无本体采集成本可降至真机采集的一半左右,在部分场景中甚至可以降到三分之一以下,具体取决于场景和任务难度。”
这一技术飞轮已在真实场景中获得验证。在江西南昌,传统3C平板量产产线完成规模化落地验证,产线作业成功率达99.99%。
数据,决定了机器人的大脑。那么,机器人的“ChatGPT 时刻”究竟需要多大规模的数据?
姚卯青认为,如果将这一时刻定义为机器人能够在物理世界中“开箱即用”,完成日常任务,并跟随开放式自然语言指令行动,那么具身数据规模与语言模型预训练语料,还存在万倍以上差距。
物理世界噪声更大、信息冗余更高,要实现对通用物理规律、开放式指令理解与任务规划能力的隐式掌握,需要大概亿小时级别的数据,才能让常见任务的基础成功率达到70%—80%。
围绕数据来源,与会专家们形成了一个重要共识:物理AI的数据不可能只依赖单一来源,而将形成由互联网数据、第一视角数据、UMI/Ego 数据、真机数据、仿真数据与部署回流数据共同组成的“数据配方”。
“这个行业需要非常多的人参与,才能加速在2027年实现目标,否则凭单个品牌也很难做这样的事情。就像要实现网约车,它也需要滴滴自己的车队,滴滴自营之外很多是其他平台共享的资源。数据的场景更加碎片化,比如京东可能有自己的零售物流数据,是非常好的数据来源渠道和平台。”在姚卯青看来,无论是蚂蚁还是荣耀、京东等参与者,都能起到催熟产业链的效果,自己对竞争也非常兴奋。
以备受关注的家庭场景为例,这是机器人最复杂、最不标准化的应用环境之一。不同家庭的空间布局、餐具、衣物、家具和生活习惯差异巨大,机器人必须同时解决精细操作、安全交互、环境泛化等问题,并满足低成本硬件和持续可靠运行的要求。
“短期内,UMI等无本体数据采集方式,成本较低,能够进入大量真实场景,而且采集到的动作与机器人任务之间具有较低偏差,有助于快速扩大预训练数据规模。长期来看,真正重要的是多样化真实部署数据。只有当机器人进入大量不同家庭、面对不同物品和任务,才能形成对通用智能真正有价值的数据回流。”Sunday Robotics联合创始人兼CEO赵子豪认为,只有每台机器人在部署中获得经验,再将相关经验反馈给基础模型,才能实现持续自我改进。
他于2021年获得加州大学伯克利分校 EECS 学士学位,随后进入斯坦福大学攻读计算机科学博士学位。在创办Sunday Robotics之前,曾就职于 Google DeepMind 和 Tesla Autopilot。
目前,该公司发布的ACT-2也将重点指向家庭机器人自主部署中的可靠性和泛化能力,而不是只追求一次性的任务演示。这意味着,单一的“叠衣服”之类的机器人,有望变得更加有用。
圆桌尾声,嘉宾们对机器人“ChatGPT 时刻”的到来时间给出判断。尽管具体时间预判从两年到五年不等,但嘉宾们形成了共同判断:物理AI的智能涌现不会来自单一模型、单一数据源或单一路线,而取决于数据规模、模型架构、仿真评测、真机反馈、部署场景与硬件系统共同构成的持续进化飞轮。
姚卯青的判断更加明确:“如果以接近GPT-3.5级别的通用能力作为标准,机器人有望在2027年底至2028年初出现较明显的能力涌现,前提是伴随千万小时数据积累的关键突破。”
所有文章未经授权禁止转载、摘编、复制或建立镜像,违规转载法律必究。
举报邮箱:1002263188@qq.com