物理AI时代来了:当机器人开始真正“理解”世界


STAR ENERGY
这一次,当AI开始走进物理世界,同样的逻辑再次成立——谁是物理AI的“大脑”,谁就站在了这个时代之上。
01.
从“聊天机器人”
到“会干活的机器人”
你可能用过ChatGPT或者国内的各类大模型——你输入问题,它给你答案,对话流畅,知识渊博。但有没有想过一个问题:它能帮你洗碗吗?
答案是不能。它没有身体,不知道碗有多重,不知道水是热的还是凉的,更不知道力气用大了碗会滑落。它懂语言,但不懂物理世界。
这就是当前AI最大的局限——它活在文字和数据的世界里,对真实物理世界的理解几乎为零。
而“物理AI”(Physical AI),正是要打破这堵墙。

02.
什么是物理AI?
一个直白的解释
先从一个类比说起。
想象一个从没出过门的书呆子。他读了成千上万本书,能背出牛顿定律,能讲清楚摩擦力的公式,但让他第一次骑自行车,他照样会摔跤——因为他知道知识,却没有理解物理世界的感觉。
过去几年的AI大模型,就像这个书呆子。它们学了互联网上海量的文字,能回答“苹果从树上落下是因为万有引力”,但它们其实并不“知道”苹果落下来的那一刻到底发生了什么。
物理AI的目标,就是让AI从“背书”变成“真正理解世界”。
技术上,这个核心叫做世界模型(World Model)——一套让AI能在脑子里模拟物理现实的系统。有了世界模型,AI不只是预测“下一个词是什么”,而是能预测“我推一下这个杯子,它会往哪个方向滑、会不会掉下桌子”。
这两件事的难度天壤之别。前者是统计规律,后者是对物理规律的真实理解。
03.
世界模型:
AI的“物理直觉”
人类之所以能轻松抓住飞来的球,是因为我们的大脑在瞬间完成了一系列物理推算——球的速度、轨迹、重力影响——我们甚至意识不到这个过程,这就是物理直觉。
世界模型要给AI装上类似的东西。它需要两种核心能力:
理解世界:知道重力、摩擦力、惯性这些物理规律。看到一个倾斜的桌面,就能预判放上去的球会滚走。
预测未来:给定一个动作,能推演接下来会发生什么。机器人伸手去抓一个湿滑的瓶子,能提前知道要用多大的力,怎么调整手指。
这个概念并不新——早在2018年,研究人员就发表了第一篇系统性的《World Models》论文,在游戏环境里让AI学会“在想象中预演”。但真正让世界模型走出实验室、进入产业,是从2025年开始的事:Meta的V-JEPA 2、谷歌DeepMind的Genie 3、OpenAI的Sora2……全球顶级AI机构密集发布世界模型产品,2026年被许多人称为物理AI的产业爆发元年。

04.
具身智能:
给AI一个身体
物理AI最激动人心的应用方向,叫做具身智能(Embodied AI)。
现在市面上的机器人能做什么?智元、宇树、优必选这些国内厂商的产品,已经能在工厂流水线上搬运、分拣,在展厅里接待访客。特斯拉的Optimus机器人学会了自己完成电池装卸任务。这些都是具身智能早期落地的缩影。
根据新华社数据,到2030年中国具身智能市场规模预计达到4000亿元,到2035年更有望突破1万亿元。

05.
最大的瓶颈:
数据,数据,还是数据
说到这里,问题来了:要训练出一个真正聪明的机器人,需要什么?
答案和训练ChatGPT一样,核心是数据——只不过难度完全不在一个量级。
训练ChatGPT这类大语言模型,用的是互联网上的文字,数量级是PB级。这些数据本来就在网上,抓取相对容易。
训练具身智能机器人,需要的数据量级是EB级,比语言模型大了不止一个数量级。更麻烦的是,这些数据不是从网上下载就能用的。机器人需要的是它在真实世界里做动作、感受力道、触摸物体的数据——这些必须在现实中一条一条地采集。
打个比方:训练语言模型就像让学生读书,书馆里书多的是;训练机器人就像让学生做实验,每一次实验都得消耗真实的材料、占用真实的时间,而且还得有老师在旁边记录每个动作细节。
这就是“数据缺口”——目前制约具身智能发展的最大瓶颈。
06.
三种“挖矿”方式:
数据从哪里来?
为了填补这个数据缺口,行业形成了三条主要路线,各有优劣,就像挖矿的三种工具。
路线一:真实数据——最纯的金矿,但极难开采
让真实的机器人在真实的环境里做任务,采集它的摄像头画面、关节角度、力觉传感器数据……
优点是数据“最真”,没有任何失真,机器人学完直接能用。
缺点是贵、慢。特斯拉Optimus的团队,40多个人干了整整一个月,才采集到几十万条遥操作数据——还只是用来训练机器人完成一个简单的电池取放动作,泛化能力依然很差。
为了高效采集真实数据,行业在探索各种方案:操作员戴上VR头盔远程“附身”操控机器人(遥操作);人穿上动作捕捉服,把人类动作“翻译”成机器人数据;甚至给操作员套上带触觉反馈的外骨骼手套,把手部每根手指的弯曲角度和用力大小都记录下来。
路线二:仿真数据——成本极低,但有“纸上谈兵”的风险
既然真实采集太贵,为什么不在电脑里模拟一个虚拟世界,让机器人在里面学习?
这就是仿真数据的思路。在英伟达的Isaac Sim这类仿真平台里,可以用GPU集群短时间生成海量数据,成本仅是真实采集的几千分之一,而且能随意生成各种罕见的极端场景——比如让机器人在极端光线下操作湿滑的透明物体,这在真实世界几乎无法批量复现。
但有一个致命问题,叫做Sim2Real Gap(仿真与现实的鸿沟)。
再逼真的仿真,物理细节也和现实有出入——摩擦力不对、材质的弹性系数不准、传感器噪声模式不一样……结果就是,机器人在虚拟世界里练得炉火纯青,一到真实场景就手忙脚乱,像一个只在游泳池里练过蛙泳、突然被推进海里的新手。
路线三:视频数据——来源最广,但需要“翻译”
互联网上有海量的人类做动作的视频——做饭、搬运、组装——这些都是宝贵的行为数据。如果能把这些视频“翻译”成机器人能学习的数据,数据量问题就迎刃而解了。
这是目前最热门的新方向。特斯拉Optimus近期已经放弃了传统的遥操作,转向深挖互联网视频。Figure AI的机器人甚至实现了“零样本迁移”——完全基于人类视角视频训练后,机器人能直接执行自然语言指令。
但挑战同样很大:视频里没有力觉信息,镜头切换会打断连续动作,人类的手和机器人的机械手运动方式完全不同……所以这条路需要大量“升维”技术,把2D视频信息补充成机器人能直接用的3D动作数据。

07.
物理AI的更大版图
机器人只是物理AI最直观的应用。这场变革,其实在更多领域悄悄发生:
自动驾驶:世界模型让汽车能在脑子里“想象”极端路况,比如结冰路面急刹车、突然窜出的行人——这些场景在现实中几乎不可能批量测试,但在世界模型里可以无限演练。
工业制造:物理AI与仿真软件结合,让工程师在数字空间里验证新产品设计,大幅缩短研发周期。
游戏与虚拟现实:世界模型可以生成更逼真、物理规律自洽的虚拟世界,NPC的行为不再像走程序,而更像真实的人。

08.
这一切意味着什么?
回到最开始的问题:AI能帮你洗碗吗?
现在还不能。但这个答案正在被物理AI一点点地改写。
2026年,AI发展的重心正在发生一次根本性的迁徙——从以对话和生成为核心的“语言智能”,转向以理解和改造真实世界为目标的“物理智能”。这不是方向之争,而是AI进化的下一级台阶。
而每一次跃迁,都会诞生一群定义时代的公司。
上一个台阶,大语言模型的“大脑”决定了一切,OpenAI、人类们迎来了革命的核心基础。这一次,当AI开始走进物理世界,同样的逻辑再次成立——谁是物理AI的“大脑”,谁就站在了这个时代之上。
真实数据的稀缺、仿真与现实的鸿沟、跨平台数据壁垒,这些问题已经在桌面上摆得很响。而产业最需要的,是能在这些问题上给出核心答案的玩家。
入场的窗口,正在打开。
你家厨房里的那个堆碗,也许真的用不着等太久——但更重要的是,谁能让机器人真正“懂”洗碗的大脑?