造人形机器人比造车还简单?张巍:大脑已达GPT-3水平
人形机器人什么时候才能走出展馆,真正帮人类干活?在2026世界人工智能大会上,这个问题被反复提起。7月19日,智元动力创始人、南方科技大学讲席教授张巍给出了一个相当反常识的判断:人形机器人代表的具身智能,正处在指数级增长曲线上,整个机器人的大脑系统已经达到了GPT-3的水平。
机器人比造车还简单?
张巍的观点让不少人吃了一惊——他认为机器人其实很好造,人形机器人也不难,比光刻机、飞机甚至汽车都简单,零件数只有汽车的十分之一。那为什么飞机天天飞、汽车满街跑,人形机器人却大多还在展馆里?他的答案是:缺的不是能造身体的人,而是核心能力——AI,特别是来自物理世界数据的物理AI。
物理AI的数据不来自互联网,而是来自真实的物理体验,这使它成为AI领域最具挑战性的应用之一。张巍打了个比方:人类大脑从概念上看并不复杂,任务就是接收指令、理解意图、观察环境、计算如何移动,本质上是一种映射。真正卡住行业的是数据匮乏。他认为技术范式已经相对收敛到纯数据驱动,剩下的更多是工程和细节问题。所有探索,本质上都是在降低完成一个任务所需的数据成本。
大脑的三层架构
张巍把机器人的大脑系统分成三层,有点像Figure的架构,但细节上差异不小。最上层类似人类的前额叶皮层,是一个由大语言模型、视觉语言模型甚至未来世界模型驱动的思考引擎,属于智能体系统,负责记忆管理、指令收集、信息理解、任务规划和决策,只管想,不管动——他称之为系统2。中间层是视觉运动皮层,接收上层决策,观察环境,制定运动计划。最底层是小脑和运动控制系统,负责完成动作,动起来不用想。
张巍强调,行业的真正挑战不是把某一层做到完美,而是让这三层在毫秒级的实时系统里协同工作,并且和硬件一起联合优化。智元动力把这个方向叫做大小脑融合技术,也是公司最重要的投入方向之一。
机器人脑的GPT时刻
如果非要用GPT时刻来比喻,张巍判断整个机器人的大脑系统已经相当于GPT-3的早期阶段,这和很多人认为“还早得很”的判断完全不同。但他提醒,机器人的大脑不是单一模型,而是由大语言模型、视觉语言模型、世界模型、记忆管理、任务规划和运动控制组成的系统。智元动力的系统叫COSA。
他举例说:如果系统2由LLM驱动,就像瘫痪在床的人,能想但不能动;由VLM驱动,就像有眼睛的残疾人,能看世界;加上世界模型,就像学会了物理的霍金,能理解和预测物理世界。具身智能就是要让这个聪明的系统2引导行动,像帮残疾人做康复训练,通过数据和练习获得技能。张巍还提醒,GPT-3到GPT-3.5用了两年多,而机器人的大脑是个系统,不是单一模型决定的,这是他跟很多人不同的思考。
技能不需要很通用
在技能学习上,张巍也提出了反常识的观点:技能不需要很通用才算有大脑。一个人不会拧螺丝、不会开车,照样是正常人有大脑。技能的通用性不代表智能水平。技能构建取决于先学什么、后学什么,以及对应的数据成本。不同技能的难度差异很大,比如跳舞不需要和环境实时交互,相对简单;爬楼梯需要实时交互,难度大得多。
智元动力的机器人Ollie爬楼梯就是实时大小脑融合技术的例子,因为楼梯很大程度上可以在仿真环境中完成;而擦桌子必须依赖真实机器数据。张巍介绍,公司去年研发、今年发布的COSA系统,能接收人类指令,通过系统2规划任务,然后调度导航定位并执行具体任务。比如送包裹,机器人会先给客户拿水再送包裹,实时生成动作。最近COSA完成了一次重要升级——全自主、实时推理的长距离任务,无需远程操作或遥控器,在家庭环境中用单一模型、单一技能完成全身运动和操作,整个模型纯数据驱动,没有专家规则。他表示,除了Figure,很少有公司能完成这样的通用长距离移动操作任务,而结合全身运动和操作的系统尤其罕见。
商业化:通用身体加应用
关于商业化,张巍总结了人形机器人的根本逻辑:通用身体加应用。单个技能比如跳舞价值有限,但不断叠加不同技能和应用,不改变机器人配置,最终会出现“吸收”的临界点,足够多的应用开始围绕通用身体聚集。他认为整机厂在产业链中最关键,因为它连接上下两端。智元动力定位为产品导向、具备大脑能力的整机厂,技术上全面对标Figure,产业化上更激进,口号是“服务人,不服务流程”——两条腿的人形机器人应该服务人而不是生产流程,所以不优先做工业场景,更适合在人类环境里做接待和公共服务。
他总结商业化的关键是:构建一个技能的数据成本,必须小于这个技能创造的价值,这样技能才值得做。

关键要点
- 张巍认为人形机器人比汽车好造,零件数只有汽车的十分之一,行业瓶颈在数据而非硬件
- 机器人大脑系统已达GPT-3水平,但并非单一模型,而是由LLM、VLM、世界模型等组成的系统
- 智元动力定位为产品导向的整机厂,已获阿里、京东、蔚来资本等投资,完成多轮融资
- 商业化逻辑是“通用身体+应用”,技能的数据成本必须小于其创造的价值