# 什么是具身智能?它跟 AI 的关系是什么?
**作者**: snowboat
**日期**: 2026-06-16T23:52:36.000Z
**来源**: [https://x.com/snowboat84/status/2067032626821747178](https://x.com/snowboat84/status/2067032626821747178)
---

这两年是大语言模型当道。ChatGPT、Claude、Gemini把写文字、写代码、生成图片、做翻译这些事基本都包了,一个对话框几乎能顶过去一堆软件。
但越来越多人开始怀疑这条路有没有局限性。批评的核心是,自回归模型说到底是在预测下一个词,它的全部知识都来自互联网上的文字,从不接触真实世界,再怎么堆参数和数据,也未必通得到更高级的智能。
这种怀疑把注意力推向了别的赛道,讨论最多的有两个。一个是世界模型,让AI在脑子里建一个能预测物理后果的世界。一个是具身智能,让AI长出身体、进到物理世界里去。后者尤其热,连"具身比大模型更牛"这种话都出来了。
可具身智能到底是什么,很多人其实说不清楚。VLA、人形机器人、世界模型、sim-to-real、扭秧歌,热词满天飞,却很少有人把它从头到尾捋一遍,让一个普通人能判断它有没有前途、前途在哪。
这篇文章就来做这件事。从定义讲起,捋一遍它三十多年的历史,看清楚现在到底做到了哪一步、又卡在哪里,最后回答两个问题:它和AI到底是什么关系,它到底能不能成。
# 一、具身智能到底是什么
## 1.1 一句话定义和那个闭环
先给一个能记住的定义:具身智能,是长在一个能感知、能行动的身体上,并且通过和物理世界互动来学习和工作的智能。
关键词有三个,身体、物理世界、互动。少了任何一个都不算。一个只会处理文字的大模型,再聪明也没有身体,它读一万本菜谱也不会颠勺。
具身智能的核心是一个闭环:感知周围环境,做出决策,执行动作,动作改变了环境,再重新感知。这个圈一秒钟可能要转几十次。你伸手去端一杯水,手指碰到杯壁的瞬间,皮肤的触觉反馈立刻让你微调力度,这就是闭环在工作。
纯软件AI和具身智能的根本分界,就在这个闭环有没有真的接进物理世界。大模型的闭环是在文字里打转,输入文字,输出文字。具身智能的闭环必须穿过一个真实的身体,落到真实的桌子、杯子、地面上。这一步之差,后面会看到,差出了一整个数量级的难度。
差在哪?差在物理世界不给你重来的机会。大模型答错了,你点个重新生成,没有任何代价。机器人把杯子摔了,杯子就是碎了,把人撞了就是撞了。文字世界里一切都可以撤销,物理世界里很多动作不可逆。而且物理世界是实时的,杯子从桌沿滑下去那零点几秒,你不接住就摔了,没有时间让你慢慢推理。这两个约束,可逆性和实时性,是软件AI从来不用面对的。

## 1.2 具身智能和机器人不是一回事
最常见的混淆,是把具身智能等同于机器人。这两个词指的根本是两样东西。
机器人是身体,是硬件。它几十年前就有了,而且本身可以很笨。汽车厂里那些挥舞的机械臂,几十年如一日重复同一个焊接动作,它是机器人,但它没有任何智能,断电重启它也不知道自己刚才在干嘛。
具身智能是另一回事,它主张智能必须长在身体上,是那套思路加上那套能力。同样一条机械臂,如果它能通过自己的摄像头看、通过自己的力觉去试,并且在试的过程中越做越好,那才沾上了"具身"。
为了讲清楚,我把市面上的东西分成三类:
类型 例子 AI在哪 算不算具身智能 传统机器人 汽车厂焊接机械臂 没有AI,纯预设程序 不算 AI加机器人 餐厅送餐车 AI和身体是解耦的 勉强算半个 具身智能 会自己学着抓取的机械手 AI耦合进感知到行动的闭环 算
中间那一类最容易被误认。送餐车确实有AI,它用激光雷达建图、规划路线、绕开客人,但它的"大脑"和"身体"是两套独立模块拼起来的,导航算法不关心轮子怎么转,它只管下指令。这种解耦的做法在工业上很成熟,但它不是具身智能想走的路。
判据其实就一条:这个AI,是不是真的在通过身体的感知和行动来学习。是,就是具身。不是,身体只是个执行外设。

## 1.3 为什么"具身"天生就难:莫拉维克悖论
要理解具身智能为什么这么折腾,得先认识一个三十多年前就被点破的现象,莫拉维克悖论。
卡内基梅隆的机器人学家Hans Moravec在1988年的著作《Mind Children》里写下了这个观察:对人类越简单的事,对机器越难,对人类越难的事,对机器反而越容易。下棋、做积分、背圆周率,这些让普通人头疼的事,计算机轻松碾压。看一眼、走两步、抓住一个杯子,这些一岁小孩都会的事,机器做起来却难如登天。
为什么会这样?Moravec给的解释很有说服力。感知和运动这套能力,是几亿年进化压进我们身体里的,压得太深,深到我们自己完全意识不到它有多复杂。你抓杯子的时候不需要"想",但你的神经系统在那零点几秒里做的计算量,远超你算一道微积分题。进化没有给这套能力留下任何说明书,没有教科书,没有数据。

抽象推理就不一样了。下棋、算术这些能力是人类最近几千年才发展出来的,浅,而且高度形式化,能写成规则、能记成符号,机器学起来反而顺手。
这个悖论对具身智能是个坏消息,因为具身智能整个泡在"对机器最难"的那一侧。它要解决的全是看、走、抓、拧、叠这类事。后面几章讲的所有困难,根子都能追到这里。
# 二、这套想法是从哪来的
具身智能听起来像个新词,其实它的思想源头能往回追三十多年,甚至更早。2023年之后被重新包装成产业热词的这套东西,骨架是老的。
## 2.1 三层思想源头
把具身智能的源头分成三层,时间线就清楚了。
最底下一层是哲学。这得先提一句17世纪笛卡尔的身心二元论。笛卡尔认为,心灵和身体是两种彻底不同的东西,思考的那个"我"是精神,身体不过是它驱使的一台机器,精神就算离开身体也能独立存在,那句著名的"我思故我在"就是这套想法的底子。
法国现象学家梅洛-庞蒂(Maurice Merleau-Ponty)1945年的《知觉现象学》正是冲着这个观点来的。他反对把心灵和身体这样切开,主张意识是"具身的",身体是我们拥有世界的一般媒介。用大白话说,心智离不开身体,你不可能把思考从一个会感知会动的身体里干净地剥离出来。
往上一层是认知科学。这一层有三本公认的奠基之作。最早是1980年,两位语言学家George Lakoff和Mark Johnson写了《我们赖以生存的隐喻》(Metaphors We Live By),论证人的概念系统是从身体经验里长出来的。我们说"心情很高"、"情绪低落",这个"高"和"低"就来自身体对上下的体验。
1991年,Francisco Varela等三人的《具身心智》(The Embodied Mind)第一次系统提出了"具身认知"这条路径。到1997年,哲学家Andy Clark的《Being There》更进一步,直接把具身认知接到了人工智能和机器人上,主张认知是大脑、身体和环境合力"撑"起来的,单靠一个大脑撑不住。
最上面一层才是AI和机器人。前两层都还停在"人的心智"上,真正把"具身"落成工程主张的,是MIT的Rodney Brooks。1980年代末到90年代,他主张机器不必先在脑子里把世界算明白,靠身体直接跟环境打交道照样能行动,一下把具身从思辨拽进了实验室。
三层叠下来,结论很清楚:这是三十多年的老思想,被2023年后的产业热潮重新捡了起来。

先摆这层历史,是为了帮你校准对当下热潮的判断。知道这套想法三十多年前就被反复琢磨、也反复碰过壁,再看那些"颠覆性进展",哪些是真新、哪些是老问题换了身时髦衣裳,就容易分清了。下面两节,看看早期的人具体怎么折腾。
## 2.2 符号主义的尝试和失败
第一代做机器人智能的人,走的是符号AI这条路,后来被叫做GOFAI(Good Old-Fashioned AI,老派人工智能)。
符号AI的代表作是斯坦福研究所(SRI)在1966到1972年间搞的Shakey机器人,号称第一台能对自己的行为做推理的移动机器人。它的范式叫"感知,建模,规划,行动",一板一眼:先用传感器感知世界,把世界翻译成一堆符号,在脑子里建一个符号化的世界模型,基于这个模型做逻辑推理规划出一条路径,最后才行动。
听起来很严谨,实际在真实世界里寸步难行。Shakey要挪到隔壁房间,得先把整个环境推理一遍,慢到以分钟计,挪一步停半天。
它栽在哪?我总结了三个:
一是框架问题,它脑子里那套符号模型是某一刻给世界拍的快照,可现实一直在动,有人挪了把椅子、把箱子推到别处,快照立刻就和真实世界对不上了,它只能把整个模型重算一遍才能接着走。
二是组合爆炸,稍微复杂一点的环境,要考虑的可能性就指数级膨胀,算不过来。
三是把整个世界都转成符号再推理这件事本身,又慢又脆,现实里一个没预料到的小石子就能让它彻底卡死。
话说回来,Shakey也不是白做的。为了给它规划路径,SRI的研究者在1968年搞出了A星(A*)搜索算法,这个算法到今天还在导航、游戏、机器人里天天用。这恰好印证了莫拉维克悖论:Shakey留给后世最值钱的遗产,竟然落在规划和搜索这种"对机器容易"的抽象推理上,而它最该解决的"在真实房间里灵活移动",反倒成了它最大的短板。
这是"重脑子、轻身体"路线的第一次大碰壁。问题出在它假设可以先在脑子里把世界想清楚,再去动手,而真实世界根本不给你想清楚的时间。这个假设错在哪,下一节那个挑战者看得最清楚。

## 2.3 Brooks的工作,90年代的转向
接这个任务的,是MIT的机器人学家Rodney Brooks。他后来做过MIT人工智能实验室的主任,还联合创办了iRobot,就是做扫地机器人Roomba的那家公司。Brooks看不下去符号主义这套打法,1986年写了篇论文,提出一个针锋相对的架构,叫包容架构(subsumption architecture)。
Brooks的核心主张听着像挑衅:别在脑子里建什么中央世界模型了。他后来在1991年那篇《Intelligence Without Representation》里有句广为流传的话,大意是与其在脑子里建个世界的模型,不如直接把世界本身当成模型,"世界是它自己最好的模型"。传感器直接驱动动作,不绕中央推理这个大圈子,像昆虫一样反应式地行动。

他真做了这样的机器人。他造的六足昆虫机器人Genghis,没有中央大脑做规划,每条腿各自管自己,靠局部的传感器到马达的直接耦合,叠加起来居然能爬过乱石堆。这套打法证明了一件事:很多看似需要"智能"的行为,其实不需要先想明白,边动边反应就行。

Intelligence Without Representation的插图
90年代还有另一条暗线在并行推进。Sebastian Thrun这些人把概率方法引进了机器人学,用概率来处理感知里无处不在的不确定性,催生了SLAM(同步定位与建图)这类关键技术,让机器人能一边走一边搞清楚自己在哪、周围长什么样。这条线的集大成之作是Thrun、Burgard、Fox三人2005年的教科书《Probabilistic Robotics》。
还得补一条更硬核的暗线,经典控制。波士顿动力那些惊艳的后空翻、跑酷,真正的底牌是模型预测控制(MPC)和轨迹优化这套数学,不是什么深度学习。每一个炫酷动作,背后是工程师离线用轨迹优化预先算好的动作模板,再由控制器实时执行。这套东西强归强,但全靠手工设计,换个动作就得重做一遍,完全不通用。要说明的是,这是早期的打法,波士顿动力2024年起也在和丰田研究院合作,用"大行为模型"来训新一代电动Atlas,开始往学习这条路上转了。
这一代人,符号主义、行为主义、概率方法,各有各的聪明,但撞上了一个共同的天花板,谁都解决不了"泛化"。换个房间、换个物体、换个任务,之前那套就得推倒重来。怎么让机器人学会的东西能迁移,是下一代要回答的问题。
# 三、神经网络让机器人睁开眼、学会动
## 3.1 深度学习让机器人能看了
转折发生在2012年。那一年,多伦多大学的Alex Krizhevsky、Ilya Sutskever和Geoffrey Hinton做出的AlexNet,在ImageNet图像识别大赛上把错误率一下打到15.3%,甩开第二名十个百分点,引爆了深度学习的视觉革命。
这件事对机器人是地基级的。在AlexNet之前,让机器可靠地认出"这是一个红色的杯子、它在桌子左边"是很难的,靠手工设计的视觉特征又脆又不准。卷积神经网络(CNN)来了之后,机器人第一次能比较靠谱地识别和定位物体了。
为什么这一步是地基?因为感知是行动的前提。你得先看清楚杯子在哪,才谈得上伸手去抓。机器人先睁开了眼,下一步才轮到学怎么动手。
## 3.2 怎么学会动作:强化学习和模仿学习
机器可以看清楚之后,怎么学会动作?这一代人摸出了两条路。
第一条是深度强化学习,让机器在仿真环境里反复试错,做对了给奖励,做错了给惩罚,慢慢学出一套策略。这个思路和2016年击败李世石的AlphaGo是同源的,都是深度网络加强化学习。要说清楚的是只是思想同源,具体算法路线并不一样,AlphaGo靠的是蒙特卡洛树搜索加策略价值网络,那套搜索方法在机器人的连续控制里并不适用,机器人控制走的是另一类算法。
第二条是模仿学习,也叫行为克隆,思路更直接:找个人来示范,机器看着学,把"专家在什么情况下做什么动作"当成监督学习的样本来拟合。这条线很老,1989年CMU的ALVINN让神经网络看人开车、学着自动驾驶,就是早期代表。
这里绕不开一个老大难,仿真到现实的鸿沟,业内叫sim-to-real。在仿真里练得再好,搬到真机上常常水土不服,因为仿真里的摩擦力、光照、传感器噪声和真实世界总对不齐。2017年,当时在OpenAI的Josh Tobin等人提出了"域随机化"(domain randomization)来对付它:在仿真里把各种参数大幅随机化,光照、颜色、摩擦力全都乱来一通,逼着模型去适应一个分布很广的环境,这样搬到现实里就不至于完全懵。
域随机化对刚性物体管用,但碰到软的、会变形的东西就抓瞎。仿真擅长算硬邦邦的刚体怎么运动,可一旦要算两个物体接触时的形变和受力,比如捏一块布、拧一个有阻尼的螺丝、端一杯会晃的水,物理引擎就算不准了。接触和形变这类"接触密集"的操作,恰恰是日常生活里最常见的。这道坎到今天都没真正迈过去。
这一代典型的架构,可以粗略概括成CNN加上MLP或者RNN、LSTM,前半段用CNN看图,后半段用全连接或循环网络吐出动作。这只是当时常见的范式之一,不是唯一标准答案。
灵巧操作这一块,最有代表性的尝试是OpenAI在2019年用一只仿人五指机械手解魔方。这个项目的真本事是手内的灵巧操控,整套策略完全在仿真里训练,号称等效一万三千年的经验,靠的是一种叫ADR(自动域随机化)的方法,让仿真环境的难度自动越来越高。
但"解魔方"这个说法得打个大折扣,否则会被人当场拆穿。魔方该怎么转、出哪几步,用的是一个叫Kociemba的现成算法,几十年前就有,跟AI、跟学习一点关系都没有。那只手只负责把算好的步骤转出来。更要命的是,那个魔方内部还塞了蓝牙和传感器来追踪每一块的状态,并不是纯靠摄像头看出来的。所以真正的贡献是手内灵巧操作和ADR这套sim-to-real方法,绝不是"AI自己学会了解魔方"。这个例子先记着,到第五章讲"这领域为什么容易吹"的时候还要用到。

## 3.3 这一代的天花板
神经网络这一代,让机器人会看也会学了,但很快撞上了自己的天花板。
最大的问题是,一个任务得训一个模型。教会机械臂抓杯子,它就只会抓杯子,换个盘子又得从头训。样本效率还极低,要喂海量数据才学得会一个动作。
跨任务、跨场景的泛化能力很弱,很多系统一离开训练任务就明显掉性能,加上sim-to-real那道鸿沟一直在,这一代始终没法做出一个"什么都会一点"的通用机器人。
于是有人开始想一个问题:NLP那边不是用一个大模型就把翻译、问答、写作好多任务统一了吗?机器人这边能不能也来这么一下,用一个大模型把一堆任务收进去?这个念头,把故事带进了下一章。
# 四、Transformer时代:VLA和"预测下一个动作"
## 4.1 从Transformer到VLA的谱系
2017年,Google提出了Transformer架构。这玩意儿后来撑起了整个大模型时代,也顺着一条清晰的链条爬进了机器人。
这条链条是这样的:Transformer先是被用到了视觉上,2020年提出、2021年正式发表在ICLR的Vision Transformer(ViT)让它学会了看图。接着视觉和语言被打通,出现了视觉语言模型(VLM),既能看图又能懂文字。最后再往上接一层,让它能输出动作,就成了VLA,视觉语言动作模型(Vision-Language-Action)。一句话,VLA就是一个看得懂画面、听得懂指令、还能自己输出动作的模型。
VLA这套范式背后的核心洞察是:先在互联网的海量图文上把"看懂"和"理解"学好,再把这套本事迁移到机器人身上。机器人不必从零学认识世界,它站在大模型的肩膀上。
把时间线摆出来,会发现这套东西其实很年轻:

表里第一行的RT-1是个铺垫,它把机器人的动作也变成token交给Transformer处理,但还没把互联网上学来的视觉语言知识接进来。真正把VLA立起来的是2023年的RT-2,连"视觉语言动作模型"这个名字都是RT-2的论文起的。算下来,这套范式到现在也就三年,非常年轻。
## 4.2 VLA到底长什么样
VLA听着玄,拆开看其实是三段拼起来的,而且每一段都是Transformer家族的东西。

第一段是视觉编码器,负责看,常用的是SigLIP(管语义对齐)、DINOv2(管细粒度的空间几何)这类。第二段是语言主干,负责理解指令,常用LLaMA、Gemma这些开源大模型。第三段是动作头,负责把前面的理解翻译成具体怎么动。
拿开源的OpenVLA举个实在例子,它就是DINOv2加SigLIP两个视觉编码器,接一个Llama-2-7B做语言主干,再加动作头,一共7B参数。它比Google闭源的RT-2-X(55B)参数少了七倍,却在论文测的29项操作任务上把成功率高出了16.5个百分点。
拿一句具体指令走一遍就清楚了。你对机器人说"把红色的杯子递给我",这句话先进语言主干,被理解成一个目标。同时摄像头画面进视觉编码器,识别出红杯子在桌上的位置、朝向。两边的信息汇到一起,动作头开始一帧一帧地输出:手臂往左前方移动多少、下降多少、靠近到几厘米、夹爪闭合到多大力度、抬起、转向你。每输出一小步,摄像头再看一眼最新画面,根据杯子有没有被碰到、抓稳没有,调整下一步。整个过程就是感知和行动那个闭环在高速空转。
最值得讲透的是"预测下一个动作"这件事。所谓动作,就是一组描述"下一个瞬间该怎么动"的数字,比如手腕往哪个方向移动多少、夹爪张开还是闭合。VLA干的事,跟GPT写文章一模一样:GPT是看着前文不停蹦出下一个字,VLA是看着当前画面不停吐出下一个动作,吐一个、看一眼、再吐一个,循环往复。
RT-2当年最妙的一招,就是把机器人的动作直接编码成了"词"。它把连续的动作数值切成一段段离散的token,塞进大模型原本的词表里,这样模型输出动作和输出文字用的是同一套机制,互联网上学来的语言能力就能无缝接到动作生成上。这一步是VLA能够借用大模型本事的关键技巧。
动作头怎么生成这些数字,分成了两大流派。一派是离散token自回归,把动作切成一个个离散的token,像蹦字一样一个个蹦出来,RT-2和OpenVLA是这一派,好处是和大模型天然兼容,缺点是动作被切碎了,精细度和流畅度受限。另一派是用扩散或者流匹配来生成连续的动作,π0是代表,它用流匹配能吐出又连续又高频的动作,可以做叠衣服、收拾餐桌这种双手灵巧活,控制频率能到50赫兹左右,代价是架构更复杂、更难训。两派现在还在各自迭代,没分出胜负。
还有两个常听到的概念。一个是动作分块(action chunking),不一个一个动作地吐,而是一次预测一小段连续动作,这样动作更连贯也更稳,这套方法源头是2023年斯坦福Tony Zhao等人的ACT和ALOHA项目。另一个是双系统,一套慢思考管规划、一套快反应管实时控制,分工合作,英伟达的GR00T N1和Figure的Helix是这套双系统的典型代表。
## 4.3 VLA赌的是什么
把架构拆完,得问一句:这一整套范式,到底在赌什么?
VLA赌的是一件事:把从互联网上学来的"语义理解",能不能嫁接到机器人的"动手"上。模型在网上看了几亿张图,认识了红杯子、听懂了"把杯子递给我",VLA赌的是这套认识世界的本事,可以省掉海量物理数据的采集,直接迁移成机器人的操作能力。
这个赌注的诱惑力在于,如果成了,就不用一个动作一个动作地去真机采集训练数据了,互联网上的图文白嫖就够本。机器人界做梦都想复刻NLP那条路,毕竟GPT就是这么靠互联网文本一统江湖的。
但这里埋着一个到今天都没有定论的关键问题:认识世界的语义知识,到底能不能迁移成"手该怎么精确地动"的运动控制?看懂一个红杯子,和算准你的五根手指该用多大力气、按什么角度才能稳稳捏住它而不捏碎,是不是同一种知识?
这个问题没有答案。它正是通往下一章那个"差距"的钩子。
# 五、现状:已经做到了什么,又差在哪
## 5.1 真实的成就,以及各自的水分
要判断一个领域有没有前途,得先老实盘一盘它现在到底做到了哪一步。我把成就分层列出来,每一条都顺手打个折,看看水分有多少。
语义泛化这一块,水分最少,是真本事。现在的VLA已经能在实验任务里展示一定的语义泛化,比如理解没直接训练过的物体、图标或者简单的组合指令。但这离"帮我热个饭"这种开放的长任务还差得远,理解和规划这层有真进步,可别把它当成通用家务已经稳定可用。
运动控制这一块,要分开看,因为它正是这两年刷屏最多、也最容易被误读的一块。2025年除夕,16台宇树H1穿着花棉袄上了央视春晚,张艺谋导演,扭秧歌、抛手绢、整齐变队形。同年宇树G1的功夫、后空翻、侧空翻视频全网爆火。4月北京亦庄还办了全球第一场人形机器人半程马拉松,"天工Ultra"用2小时40分跑完21公里。波士顿动力更早,后空翻、跑酷的视频惊艳了快十年。
这些都是真本事,但秀的是身体,不是大脑。会跳秧歌、会后空翻,靠的是平衡和全身运动控制(春晚那套是激光SLAM自动走位,加上强化学习练熟的固定舞步),而且这恰恰是仿真最友好的"容易区",这类动作主要是刚体运动,在仿真里好建模、好练。可一旦要机器人伸手去干一件没练过的活、抓一个没见过的物体,立刻露怯。会跳舞不等于会干活:跳舞是编排好、练熟的炫技,干活要现场应对千变万化的真实物体,那才是脖子以下最难、最缺数据的部分(下一节细说)。连波士顿动力自己,也从"秀后空翻"转向了"用大行为模型学操作",新一代电动Atlas直到2026年才开始往工厂里部署,这恰恰说明:光会动,远远不够。

所以这些跳舞机器人的前景,得拆成两半看。身体这半,尤其是便宜的中国身体,到得很快,硬件和运动控制都在快速成熟、价格在往下塌(后面宇树那段的出货量和售价就是这半在跑)。大脑那半,通用的灵巧操作,还卡在数据上,远着呢。真正难的是干活,不是跳舞。别把刷屏的舞蹈和马拉松,当成"通用机器人已经到了"的信号。
可控环境里的工业单一任务,是真落地了,但要看清落地的成色。最实在的一个案例是Figure AI和宝马的合作。两台Figure 02人形机器人,被放进宝马美国南卡Spartanburg工厂,干的活是把钣金件从料架上取下来、放到焊接夹具上,一个标准的抓取摆放动作。据多家行业媒体披露的试点数据,这个项目跑了11个月,每天工作10小时,累计约1250小时,期间配合生产了3万多辆宝马X3,搬了9万多个零件,每个班次的放置精度超过99%。要注意这些是试点期间披露的数字,不是宝马的长期量产指标。
数字很漂亮,但要看清两件事。一是它干的是一个高度结构化、单一重复的任务,料架在哪、零件长什么样、往哪放,全是固定的。二是它到现在还是个试点(pilot),不是规模量产,目前还在评估要不要扩大。
另一个常被拿来说事的是Agility Robotics的Digit机器人,2024年和物流公司GXO签了多年协议,号称业界第一个人形机器人的正式商业部署,在GXO的仓库里搬料箱。据Agility和行业报道披露,到2025年11月累计搬了超过10万个料箱。这是目前最接近"商业运营"的案例,但任务同样极度单一,就是搬箱子。
真正在量产出货这件事上,中国公司跑在前面。宇树(Unitree)2025年人形机器人出货超过5500台,和智元等中国公司一起排在全球第一梯队,宇树的G1机器人售价1.6万美元起,而且它是这行里少数明确盈利的公司,按招股书口径2025年营收约17亿元人民币,同比涨了三倍多。相比之下,美国头部公司大多还停在试点、租赁部署或小规模生产阶段,没有披露能跟宇树直接对比的量产出货数字。在"真把机器人造出来卖掉"这件事上,中美差着一个数量级。

商用移动机器人是落地最实在的,比如波士顿动力的Spot去做电厂巡检、各种配送机器人。但这里要划一条关键的线:会动会看,和会动手,是两个难度量级。Spot能稳稳走过崎岖地面、能拍照巡检,早期裸机售价约7.5万美元,真到工业现场部署,再加上传感器、软件和集成,成本会高出一大截。但你让它伸手拧个阀门、换个零件,立刻就露怯。能跑能看的,离能干活还远。
把这一节总结一下:脖子以上(看懂、听懂、规划)进步神速,脖子以下(精确地动手操作)举步维艰。这个割裂,是理解整个领域的钥匙。
## 5.2 那个没有互联网可抄的数据问题
现在该亮出全文最核心的那个约束了:这世界上不存在一个"物理交互的互联网"。

GPT为什么能成?因为人类把几十年的文字、代码、对话全都免费堆在了互联网上,几十万亿字的现成数据,模型拿来学就行。可机器人需要的数据是另一种东西,是"在什么情况下,手该用多大力、按什么轨迹去动",这种数据互联网上一个字都没有。你刷一辈子抖音,也刷不到"如何捏鸡蛋不捏碎"的力觉数据。
那能不能自己造这种数据?三条路,每条都有天花板。
第一条是遥操作,让真人戴着设备实时操控机器人,把人的动作录下来当训练数据。这条路数据质量最高,但贵得离谱,一个真人盯着一台机器实时操作,根本没法并行,采集速度慢得让人绝望。
遥操作有多重要,看一个公司的坦白就知道了。1X公司的家用机器人NEO,售价2万美元或者每月499美元订阅,计划2026年交付。1X的CEO Bernt Børnich公开承认,初期大量工作要靠远程操作员完成,早期用户得预约一个远程操作员来接管部分任务,机器人在旁边"看着学"。换句话说,所谓"自主"的家用机器人,现阶段背后常常坐着一个真人在操控。这不是1X一家的事,有行业报道指出,部分公司的演示视频背后也有人类"木偶师"在远程操控,看的时候要分清这是正式部署还是演示。
第二条是仿真,在虚拟世界里让机器人自己练。这条路能并行、能加速,但前面说的sim-to-real鸿沟一直在。仿真擅长刚体运动,可一旦涉及接触密集的操作,比如捏一块软布、拧一个有阻尼的螺丝,仿真就力不从心,因为接触和形变在物理引擎里极难算准。
第三条是真机自采,让机器人在真实世界里自己摸索。这条路撞上一个死结,先有鸡还是先有蛋:机器人得先有点本事才能采到有用的数据,可它的本事又得靠数据来练。
这里还藏着一个连遥操作都解决不了的盲区,触觉。前面第二章那个掀起行为主义革命的Rodney Brooks,2025年9月写了篇很尖锐的文章,说现在这些人形机器人想在几十年内达到人类的灵巧度,是"纯属幻想",还点名了特斯拉的Optimus和Figure。他的核心论据是,光靠看人类视频学操作,缺了最关键的一环,丰富的触觉和力觉反馈。他举了个数字,人的一只手上有大约1.7万个低阈值的机械感受器,你拧瓶盖、捏鸡蛋时手上那种细腻的力反馈,互联网视频里一点都没有,遥操作也很难完整录下来。同一个人,三十多年前掀翻了符号主义,今天又来给人形机器人的热潮泼冷水。
数据问题之上,还叠着好几层障碍。莫拉维克悖论的诅咒一直在,越是日常的操作越难。长尾问题无解,家里的环境千奇百怪,你永远遇得到没见过的情况。可靠性的要求还是不对称的,聊天机器人答错一句无所谓,机器人抓菜刀时95%的成功率就是灾难。
这里要引入一个特别有用的变量,"环境的可控度"。工厂为什么能落地而家庭不能?因为工厂的环境是高度可控的,光照固定、物体固定、流程固定,机器人面对的世界很窄。家庭环境是开放的、混乱的、每天都在变的,可控度极低。可控度越高,越容易落地,这条规律几乎能解释具身智能现在所有的落地分布。
最后还有一道经济账。就算技术上能做,成本能不能压到比雇人便宜?很多任务卡在这道门槛上,技术上勉强能做,但算下来不如雇个人划算,那就落不了地。
## 5.3 怎么判断真假:一把六问的尺子
这个领域特别容易吹,原因不复杂。成绩大多是在仿真里跑出来的,分布内和分布外的落差很容易被藏起来,成功率这种指标只看最后成没成、过程崩没崩你看不见,长任务一长就容易垮,而且整个行业到现在都没有一个统一的基准。
第三章那个OpenAI解魔方就是典型,包装成"AI学会解魔方",实际求解靠现成算法、状态靠内置传感器,真本事只是手内操作那一块。这种把演示包装得超出实际的做法,是整个领域的通病,不止OpenAI一家。
所以给你一把可操作的尺子,看到任何具身智能的"突破",拿这六个问题怼回去:
一问,是真机还是仿真?仿真里的成功,离真机能用差着十万八千里。
二问,物体和环境是见过的还是没见过的?分布内刷出来的高成功率,换个没见过的就可能崩盘。
三问,给的是成功率数字还是一段精心剪辑的视频?视频可以拍一百遍取最好的一遍。
四问,是机器人自主完成的,还是背后有人在遥操作?遥操作的演示,秀的是人的手不是AI的脑。
五问,任务有多长?十秒的短任务和需要连续几十步的长任务,难度是指数级的差别。
六问,能不能复现?换个团队、换个场地能不能跑出同样的结果?
这六问怼下去,大部分"震撼演示"会瞬间瘪掉一半。

顺便说一句,连这个领域内部对"该往哪走"都没吵明白。VLA这条路是一派,主张靠预测动作把问题端到端解决。杨立昆(Yann LeCun,Meta首席AI科学家)这些人押的是另一条路,世界模型,主张机器人得先在脑子里建一个能预测物理后果的世界模型,才能真正聪明地行动。两条路谁对,现在没有答案。
# 六、具身智能到底能不能成
## 6.1 这个领域到底想要什么:把GPT搬进物理世界
把现状盘清楚了,再来谈前途,才不至于空对空。先说清楚这个领域到底想要什么。
这个领域想要的,是一个通用物理智能体:你用大白话下任意指令,"把客厅收拾一下"、"去厨房给我倒杯水",它能在一个从没见过的真实环境里,自己感知、自己规划、自己动手完成。说白了,就是把文字世界里那个无所不能的GPT,整个搬进物理世界。激进一点的人管这个叫"物理AGI"。
工程上的中间目标,是复刻GPT走过的那条路。GPT把翻译、问答、摘要几百种语言任务,统一收敛成了一件事,预测下一个词。具身智能想干的是把成百上千种操作任务,统一收敛成"预测下一段动作"。能不能收敛成功,是这个领域成败的技术关键。
## 6.2 两个时间表
谈前途最容易犯的错,是把不同的东西混在一起笼统地说"还要多少年"。我把它拆成两条完全不同的时间表。
第一条是窄场景商业化。工厂里的某个具体任务、电厂巡检、封闭园区里的配送,这些环境可控、任务单一的场景,现在已经在落地,未来三到五年会越铺越多。这条路很实在,但不性感,它不会出现在科幻电影里,也很难让你在发布会上尖叫。
这条路上最好的反面教材是特斯拉的Optimus。马斯克2025年初放话当年要造数千到约一万台,结果实际产量远远落后,量产时间表一再后推到2026年。在2026年1月底特斯拉的Q4财报电话会上,他承认工厂里的Optimus还没有在做"有用的工作",已经部署的机器人主要用来"学习和收集数据"。从年初的产量目标到这句表态,宣传和现实之间的落差摆在那里。马斯克还喊过量产后单价能压到2万到3万美元,这同样是远期愿景价,不是现价。
资本却不管这些,钱正疯狂往里涌。Figure AI在2025年9月的C轮融资后估值冲到390亿美元,18个月里翻了约15倍,投资方里有英伟达、微软、OpenAI。做VLA基础模型的Physical Intelligence估值也到了56亿美元。机构的预测更夸张,高盛把人形机器人2035年的市场规模预测从60亿美元一口气上调到380亿美元。要拎清楚的是,估值和预测都是对未来下的注,不是已经发生的现实,这一点在讨论"前途"时千万别混为一谈。
第二条是通用机器人,进你家门、做各种杂活、像人一样随机应变。这条路按现在的进展看,十年起步,而且我个人判断,它可能永远不会以"一台全能机器人"的形态出现。

为什么?因为更可能的走向是,通用需求被拆成无数个被环境改造过的专用设备。与其造一台啥都会的家务机器人,不如把厨房改造成自动化厨房、把洗衣这件事交给一台更聪明的洗衣设备。环境去适应机器,比机器去适应环境容易得多。这一条又回到了那个"可控度"的变量上。
## 6.3 回到开头:LLM和具身谁是未来
绕了一大圈,回到开头那个说法:具身智能比大模型更牛,是不是大模型已死、机器人接棒?
这个二选一的问法本身就是错的。把两边各自的本事摆出来看就清楚了:

大模型解决的是脖子以上的问题,理解和规划,它之所以能成,是因为人类早就把这部分知识免费堆在了互联网上。具身智能卡在脖子以下,运动和操作,它之所以难,是因为这部分知识从来没有被记录下来,没有互联网可抄。两者是互补的,不是替代的。
实际上,最先进的具身智能系统,脑子那一半用的恰恰就是大模型。VLA的语言主干是LLaMA、是Gemma,它站在大模型的肩膀上去够物理世界。说大模型已死、机器人赢了,等于说房子的上半截已经盖好了,所以地基不重要了。
所以我对具身智能的判断是这样的。它的前途是真的,但前途在最不起眼的地方,在工厂的某条产线、在电厂的巡检路线、在封闭园区的配送车上,一点点铺开。那个会叠衣服、会带娃、跟你贫嘴的科幻管家,还非常远,远到不值得现在就为它激动。
真正该盯着看的胜负手只有一个,数据飞轮能不能转起来。机器人干活产生数据,数据让机器人更会干活,更会干活就被部署到更多地方,又产生更多数据。这个轮子一旦转起来,物理世界的"互联网"才算开始被一砖一瓦地造出来。它转不转得动,几年内就能看出苗头。这比任何一场后空翻的演示,都更值得你盯着。
## 作者其它文章(选)
- 长篇分析:SpaceX未来的展望
- Vibe Coding把我系统搞崩了,我对此的总结和心得
- 人工智能的工程全景(中):推理,后训练,对齐和安全
- 大语言模型的商业痛点
- 什么是控制论?控制论是AI的上辈子吗?
- 什么是世界模型?一个正在被争夺的概念
- 美国的犹太人和华人分别抢到了什么资源?详细分析
- 细说美国的华人老钱家族
- 人工智能的工程全景(上):硬件、电力、训练、推理
- 美国税收制度完全指南
- 当物理遇上AI:深度学习里的物理元素(上)
- 一文看懂美国的法律系统
- 教宗良十四世论人工智能(精华版)
- 廉颇老矣,尚能饭否:现代数学史(下)
- 一篇文章讲清楚美国的移民系统
- 大航海时代2的逆向工程实验
- 量子计算机有前途吗?
- 祖父积分学概论
- 我见青山多妩媚:二十世纪数学史(上)
- 一文讲清楚美国医疗系统
- AI 如何打进美国教育生态?
- 一篇文章看懂美国教育全生态
- 马斯克把 xAI 并入 SpaceX,到底意味着什么?
- Vibe Learning:AI 时代,学习这件事被重新组织了
- 福特经济学和 AI 经济学
- 数学照妖镜:AI 能发现新的数学定理吗?
- 一篇文章讲清大语言模型发展史
- Vibe Reading:AI 时代读书的系统化方法
- 长篇分析:Manus 案折射出的中国 AI 创业生态
- 两万字科普:AI 为什么会编程——原理、历史与未来
- 全网最详细的AI学习路线图
- AI将如何颠覆教育,普通人又应该如何抢夺教育新的生态位
- 学物理的八方英雄们,物理学已死,请转行搞AI
- 兄弟们想清楚:究竟是你为X打工,还是X为你打工?
## 相关链接
- [snowboat](https://x.com/snowboat84)
- [@snowboat84](https://x.com/snowboat84)
- [2.5K](https://x.com/snowboat84/status/2067032626821747178/analytics)
- [长篇分析:SpaceX未来的展望](https://x.com/snowboat84/status/2066674353648046515)
- [Vibe Coding把我系统搞崩了,我对此的总结和心得](https://x.com/snowboat84/status/2065586279010742687)
- [人工智能的工程全景(中):推理,后训练,对齐和安全](https://x.com/snowboat84/status/2065215177029787705)
- [大语言模型的商业痛点](https://x.com/snowboat84/status/2064858487675670625)
- [什么是控制论?控制论是AI的上辈子吗?](https://x.com/snowboat84/status/2064496706042069340)
- [什么是世界模型?一个正在被争夺的概念](https://x.com/snowboat84/status/2064135804092645410)
- [美国的犹太人和华人分别抢到了什么资源?详细分析](https://x.com/snowboat84/status/2063049247805837815)
- [细说美国的华人老钱家族](https://x.com/snowboat84/status/2062326581776011623)
- [人工智能的工程全景(上):硬件、电力、训练、推理](https://x.com/snowboat84/status/2061962883651731602)
- [美国税收制度完全指南](https://x.com/snowboat84/status/2060511915617779821)
- [当物理遇上AI:深度学习里的物理元素(上)](https://x.com/snowboat84/status/2060145538922844179)
- [一文看懂美国的法律系统](https://x.com/snowboat84/status/2059795010330251568)
- [教宗良十四世论人工智能(精华版)](https://x.com/snowboat84/status/2059434342745866391)
- [廉颇老矣,尚能饭否:现代数学史(下)](https://x.com/snowboat84/status/2059071134738620606)
- [一篇文章讲清楚美国的移民系统](https://x.com/snowboat84/status/2057980486501433383)
- [大航海时代2的逆向工程实验](https://x.com/snowboat84/status/2057264254319993332)
- [量子计算机有前途吗?](https://x.com/snowboat84/status/2056895775578456417)
- [祖父积分学概论](https://x.com/snowboat84/status/2056533111983493136)
- [我见青山多妩媚:二十世纪数学史(上)](https://x.com/snowboat84/status/2055446902171406761)
- [一文讲清楚美国医疗系统](https://x.com/snowboat84/status/2055081426744422697)
- [AI 如何打进美国教育生态?](https://x.com/snowboat84/status/2054721509420372180)
- [一篇文章看懂美国教育全生态](https://x.com/snowboat84/status/2054359249917210633)
- [马斯克把 xAI 并入 SpaceX,到底意味着什么?](https://x.com/snowboat84/status/2054000682114613488)
- [Vibe Learning:AI 时代,学习这件事被重新组织了](https://x.com/snowboat84/status/2052908751435477046)
- [福特经济学和 AI 经济学](https://x.com/snowboat84/status/2052551731385602072)
- [数学照妖镜:AI 能发现新的数学定理吗?](https://x.com/snowboat84/status/2052174034041995572)
- [一篇文章讲清大语言模型发展史](https://x.com/snowboat84/status/2051444935547912236)
- [Vibe Reading:AI 时代读书的系统化方法](https://x.com/snowboat84/status/2050008577511973253)
- [长篇分析:Manus 案折射出的中国 AI 创业生态](https://x.com/snowboat84/status/2049643679804248305)
- [两万字科普:AI 为什么会编程——原理、历史与未来](https://x.com/snowboat84/status/2048919554882215954)
- [全网最详细的AI学习路线图](https://x.com/snowboat84/status/2047457686070141051)
- [AI将如何颠覆教育,普通人又应该如何抢夺教育新的生态位](https://x.com/snowboat84/status/2044932338262667509)
- [学物理的八方英雄们,物理学已死,请转行搞AI](https://x.com/snowboat84/status/2044584627046920278)
- [兄弟们想清楚:究竟是你为X打工,还是X为你打工?](https://x.com/snowboat84/status/2043842017260908743)
- [Upgrade to Premium](https://x.com/i/premium_sign_up)
- [7:52 AM · Jun 17, 2026](https://x.com/snowboat84/status/2067032626821747178)
- [2,590 Views](https://x.com/snowboat84/status/2067032626821747178/analytics)
- [View quotes](https://x.com/snowboat84/status/2067032626821747178/quotes)
---
*导出时间: 2026/6/17 16:49:24*