当前,具身智能已经被纳入国家“十五五”规划纲要明确的六大未来产业之一。不久前,清华大学具身智能与机器人研究院院长张涛教授在“人文清华”讲坛上为我们深度解读了具身智能的技术内涵、发展现状以及未来挑战。以下是演讲主要内容。


清华大学具身智能与机器人研究院院长张涛。(资料图片)

『中国机器人足球队夺冠』

最近,大家都很关注美加墨世界杯。但是,在大家熟悉的世界杯之外,还有另一个“世界杯”——机器人世界杯。

首届机器人世界杯于1997年在日本举行。当时该赛事就提出了一个具有想象力的宏伟目标:到2050年,一支由机器人组成的足球队战胜人类足球世界杯冠军。

在2025年巴西举行的机器人世界杯比赛中,清华大学火神足球队首次获得类人组世界冠军。当这个成绩公布时,大家都感到非常高兴。

2024年和2025年,清华大学火神机器人足球队都参加了比赛。从比赛现场来看,虽然仅相隔一年,但机器人足球队呈现出的技术状态已经发生了显著变化。2024年时,机器人的移动还非常缓慢,踢球动作显得比较僵硬,场边还需要有人跟随,因为担心机器人会摔倒。根据比赛规则,一旦机器人摔倒,工作人员必须立即将它移出场外,重新整顿,再让它入场参加比赛。到了2025年,机器人足球赛真正成为机器人与机器人之间的对抗,赛场上不再允许有人跟随,完全由机器人自主移动、配合、射门,并最终分出胜负。


一台人形机器人在表演踢足球。 (新华社发)

这种巨大变化,体现了机器人的跨代式跃迁。2024年,机器人的整体运动、操作和控制方式可以被看作机器人1.0时代。这个阶段的机器人主要依赖人类编程,由人帮助它识别足球场、足球和球门,并通过程序告诉它如何前进、如何射门。

2025年的情况则完全不同。机器人不再只是被人一步步编程和指令控制,它的行为、对周围环境的感知以及机器人之间的配合、射门,都是通过训练获得的。训练之后,机器人具备了自主判断和执行任务的能力,能够自己理解场上的情况,自己决定如何前进、后退、踢球,并思考如何赢得比赛。这就是机器人2.0时代。

另一个让大家印象深刻的例子是春节联欢晚会上的人形机器人表演。2025年春晚,观众看到机器人表演转手绢;到了2026年春晚,仅仅一年时间,机器人发生了很大的变化,无论是行为还是动作都越来越接近人的状态。

这,就是我们今天要讨论的主题——具身智能。

『具身智能不是一个新概念』

具身智能到底是什么?我们先从定义说起。

具身智能并不是一个新概念,早在1950年,美国科学家图灵就对具身智能作出过相关描述:未来的机器人或者依托于物理身体的智能系统,能够对环境进行感知和交互,并具备自主规划、自主决策和行动执行的能力。当年图灵提出这一设想时,只是一种面向未来的期待。

要理解具身智能,我们常常会把它与人进行对照。具身智能的定义也是以人的能力为参照的。人主要由两大部分组成:一是脑部,二是身体。进一步来看,脑部又可以分为大脑、小脑和脑干,不同部位承担着不同功能。如果用技术语言来描述,大脑主要对应认知、理解、推理和决策等能力;小脑主要对应导航、控制、操作和协作等能力;脑干则与能量供给、感知和计算等基础功能相关。也就是说,人类智能的实现,依赖于这些系统之间的共同作用。而具身智能的目标就是拥有像人一样感知、学习和与环境动态交互的能力。

今天,随着科学技术的发展,很多与具身智能相关的研究方向都取得了巨大进步。正因为如此,我们才有可能真正回应图灵当年提出的设想,把具身智能从一种面向未来的想象,逐步转化为现实中的技术路径和产业方向。

按照字面解释,具身智能就是具有“身体”的人工智能。目前,已有大量平台可以作为具身智能的“身体”,人形机器人只是其中的一种形态。在具身智能领域,“身体”并不局限于人形,而可以具有多种不同的形式。例如,自动驾驶汽车、移动操作机器人等都可以被视为具身智能的“身体”。


在2026世界人工智能大会(WAIC)上,非夕科技的自适应机器人以其通用智能平台形态,展现了具身智能技术从模型到真实场景应用的加速落地。 (海沙尔摄)

『新一代的具身智能机器人』

在具身智能相关理论和关键技术不断取得突破之后,科学家进一步提出了一个目标——研制具身智能机器人。

机器人不是一个新事物。早在20世纪50年代,人类就已经开始制造机器人。从发展历程来看,机器人经历了三代。

第一代机器人始于20世纪50年代,主要是工业机器人。它们是一些类似人类手臂的机械臂,可以在工厂里工作。到了20世纪六七十年代,出现了第二代机器人,即有感知的机器人。它们被安装上传感器,能够感知周围的工作环境,从而发挥更大的作用。又过了大约十年,机器人进入第三代,即智能机器人,它们能够自主完成一些任务。此后,智能机器人不断发展、不断进步,到今天又进入了一个新的阶段,即具身智能机器人阶段。

这里需要指出的是,即使是智能机器人,在很大程度上仍然依赖人的编程和指令来完成任务。但进入具身智能机器人阶段之后,机器人开始具备学习能力。通过训练,机器人能够自主工作,其能力也得到显著提升。

具身智能机器人具备三个非常典型的特征——通用、交互和自主。与此同时,机器人能够在动态任务和动态环境中实现主动感知、深度推理、自主规划和灵活执行。

主动感知,是指机器人不再完全依赖人的输入,而是能够通过自身的感知系统,即传感器、算法和相关技术支持,主动了解外部世界。深度推理意味着机器人开始具备类似人类思维的能力。推理原本是人类的重要能力,而具身智能的发展目标就是让机器人也能够实现深度推理。自主规划意味着任务安排和行为决策不再由人预先设定,而是由机器人根据环境和目标自行决定。最后,机器人还需要把这些判断和规划转化为灵活执行。

由此可见,一旦具身智能机器人被研制、生产出来,并真正应用到实际场景中,它将展现出非常强大的能力。

『打造强健的“身体”』

那么,具身智能机器人究竟是什么样子的呢?

对于一个具身智能机器人而言,其核心构造主要包括两个方面:一是打造强健的“身体”,二是构建智慧的“大脑”。

先来说说如何打造强健的“身体”。

过去一年,很多公司都推出了自己的人形机器人,并突出各自的特点:有的强调灵活性,能够完成特定动作;有的强调逼真度,外形和动作都更接近人。但是,当前机器人的“身体”制造领域仍存在着诸多技术难点。

其一是轻量化,因为机器人使用的多是刚性材料,要在保证强度的同时减轻重量并不容易。

其二,从“肌肉”和“关节”来看,机器人需要依靠驱动系统实现运动和力量输出,在这方面面临很大挑战。对机器而言,既要输出大力矩,又要实现缓慢、平稳的运动,是一件很困难的事情。

比如,灵巧手就是一个很有挑战性的环节。最近一年,很多企业都研制出了机器人的灵巧手。有的机器人可以拿鸡蛋,有的机器人可以冲咖啡,也有的机器人可以玩魔方。此外,前沿研究还在探索手指触觉传感器。有的研究能够在一个手指上布置约2000个触觉传感器,其难度非常大。

再比如高性能腿足。今年在北京亦庄举行的人形机器人半程马拉松比赛中,荣耀研发的“闪电”机器人以50分26秒的成绩夺冠,并打破了人类男子半马世界纪录。这说明机器人在速度上已经展现出非常强的能力。高性能腿足技术的核心,一是高速步态,这要求机器人能够以很快的速度运动;二是动态平衡,也就是机器人在奔跑过程中要保持平衡,这种平衡不仅是腿足本身的平衡,还包括整个身体的平衡。

其三,需要优化机器人的“心脏”,也就是电池的性能。对人形机器人来说,电池相当于能量输出系统。人类在完成一些特殊动作或特殊工作时,对瞬时能量输出有很高要求。例如,运动员跳高时,需要在一瞬间输出巨大能量来支撑身体跃起。对机器人来说,问题就在于如何在瞬间产生这么大的能量,而这种能量只能依靠电池提供。因此,当前很多研究都在探索如何制造更加轻量、高密度的电池。

『构建智慧的“大脑”』

接着再来讲如何构建智慧的“大脑”。具身智能机器人最大的跨越式发展,主要体现在智慧“大脑”上。

首先是具身智能“大脑”的构建。我们把人工智能领域的重大技术突破运用到机器人上,为机器人构建了一个智慧大模型,我们将其称为“具身智能多模态世界模型”。

这里需要说明的是,具身智能模型不同于ChatGPT之类的语言大模型。语言大模型技术赋能机器人,不只是简单地把原有大模型直接装在机器人上,因为机器人有着非常特殊的需求:它需要与真实的物理世界发生互动。因此,只有“具身智能多模态世界模型”才能帮助机器人完成与环境交互、感知并执行任务。目前,世界各地的许多科学家都在从事相关研究,希望构建出一个通用的具身智能世界模型。

同时,机器人还有一个非常特殊的需求:这个具身智能世界模型不能运行在遥远的算力中心,也不能完全依赖云端,而必须放在机器人的“大脑”中。因此,需要构建一个高智能、低算力、低能耗的端到端的世界模型。这些关键词本身就说明,要构建这样的具身智能世界模型难度非常大。

尽管目前具身智能世界模型的水平还没有达到很高要求,但2.0时代机器人的核心能力已经出现,那就是学习。现在不少公司在做数据采集的工作,就是让机器人通过模仿人的行为进行训练和学习,从而不断提升能力。比如,在汽车装配车间里,把工人钻孔、搬运、装配等操作过程采集下来,并整理成一个个动作序列,再用这些序列训练机器人。最终,机器人就可以独自完成钻孔、搬运、装配等一系列工作。

有了“大脑”和学习能力之后,还需要把这些能力装入机器人的身体,并由一系列硬件支撑,其中最重要的就是芯片。有人说,人类属于碳基世界,而机器人属于硅基世界,原因就在于机器人身上装有大量芯片。

其次,为了构建智慧“大脑”,机器人还需要具备感知周围世界的能力。借助计算机视觉技术、各种视觉传感器和激光雷达,机器人已经能够在现实环境中实现许多人类的感知能力。

比如定位。人到一个地方,通常会知道自己在哪里,这就是定位。在这一点上机器人可能比人更强,除了定位外,它还能建立一张非常精准的地图。此外,机器人还可以完成识别、分类、检测、测量等任务,这些都依赖于它的感知能力。

未来的机器人感知会逐步接近人类水平,这就是多模态感知融合。所谓多模态感知融合,是指人对世界的认知依靠多种感官共同实现。机器人也会把这些感知能力集成在一起,构成机器人的多模态感知,而且它们的某些感知能力可能比人更强。

再次,机器人需要实现可靠稳定的动态规划与控制。所谓控制,就是让机器人实现对自身各种行为的调控。机器人能够在复杂环境中自主运动,这背后依靠的是高自由度、高协调的运动控制。人类的很多行为都发生在动态过程中,因此机器人同样需要具备动态规划和动态控制能力,并且做到可靠、稳定。

最后,智慧“大脑”还有一个重要的方面是交互。所谓交互,就是人和机器人之间如何协同、如何交流。

大模型使语言交互成为可能。同时,现在又出现了一些新的交互方式。比如脑机接口,就是通过提取人的大脑信号,让机器人对脑信号进行识别,从而判断人在想什么、想表达什么,并据此与人进行交流。

此外,还有一个有意思的方向,叫情绪理解,就是让机器人知道人的心情,判断一个人是高兴还是烦恼。这听起来似乎不可思议,但相关技术已经在研究中。未来这如果真的成为现实,人和机器之间的交互就会变得更加自然、准确。

『具身智能与人类社会』

那么,未来具身智能将有哪些应用场景呢?

工业制造是具身智能非常重要的应用场景。工业场景中有很多任务适合由机器人完成,比如目标明确、任务重复、工具充足、环境可控的工作。如果机器人具备更高智能,能够自主感知、自主规划任务并最终自主执行,就可以显著提升工业机器人的能力。比如3C制造,也就是计算机、通信和消费类电子产品制造,其中消费类电子产品包括相机、手表等,其生产过程中有很多工序都可以由机器人完成。再比如,汽车生产过程中的大量操作也完全可以由机器人承担。

养老育儿也是具身智能机器人重要的应用场景。中国已经进入老龄化社会,老人需要陪伴和护理,孩子也需要看护,机器人在协助养老育儿方面无疑具有非常广阔的前景。

再比如娱乐和教育。在娱乐方面,机器人可以打乒乓球、下围棋,也可以跳舞、打拳、踢足球等。在教育领域,未来世界上可能会出现“机器人学校”,学校里有很多机器人参与授课、陪学生一起玩耍。

未来,具身智能还能让许多原本不可能的事情变成可能。比如,中国要在月球上建设科研基地,很多事情可以依靠具身智能机器人去完成,从而推动人类走向跨星球发展。

谈到具身智能和人类社会的关系,还要进一步讨论这样一个问题:具身智能将给人类社会带来怎样的变化?

首先需要明确的是,人类发展具身智能的目标是什么。用一句话概括,就是为了提高人类的生活质量,让人类的生活更加美好。未来具身智能的发展必须以这一目标为出发点。

我们可以预测,随着具身智能的发展,未来人类社会将出现一系列新问题。比如,大量工作将由机器人完成,很多人会面临失业。此外,还有很多工作将由人和机器协作完成。由此,人机之间会产生许多新的关系,包括法律关系、经济关系、安全关系甚至伦理关系。具身智能带来的这些变化,必将对人类社会产生深远影响。

如何面对具身智能给人类社会带来的巨大挑战?我在这里引用科幻小说家阿西莫夫提出的“机器人三定律”:第一,机器人不得伤害人类个体,也不能看着人类遇到危险不管。第二,机器人必须服从人类的命令,除非命令和第一定律冲突。第三,机器人要保护自己,只要不违反前两条定律。这些原则在今天仍有现实意义。

最后我想说,具身智能不仅要解决技术问题、应用问题,更蕴含着许多深层次的人文内涵。我们研究具身智能、制造具身智能机器人,正是为了促进人类社会的发展,让机器人成为人类的工具和伙伴,从而更好地服务人类。

原标题:《2050年具身智能机器人足球队战胜人类足球世界杯冠军,这个目标能实现吗》