STEP 06 · 物理世界线(时间 + 上下游)

具身智能

前面学的是「会说话、会办事」的软件智能。本页补上另一条主线: 智能住进身体,在真实世界里感知与行动。 我们用无人驾驶约十年关键历程当切入点——它是目前最完整、最公开的「具身系统」落地实验室。

具身智能概念示意:身体、感知、决策与行动

本页怎么读(逻辑顺序)

A. 是什么(具身 vs 纯语言模型)→ B. 上下游流水线(感知→世界模型→规划→控制)→ C. 时间线(从 ALVINN/DARPA 到 Robotaxi 与机器人基座模型)→ D. 无人驾驶专线(十年关键节点 + SAE 等级)→ E. 通向 AGI 的概念前瞻(均标注论文/标准/开源来源)→ F. 和你有关 / 怎么用。

A. 具身智能是什么

是什么

具身智能(Embodied AI / Embodied Intelligence)强调:智能体通过身体与环境交互——用传感器感知、用执行器行动,在反馈中学习。不是只在文本里「说」,还要在物理世界里「做」。

和你有关

无人车、扫地机、仓储机器人、人形机器人、无人机,都在走这条线。你坐的 Robotaxi 试验服务,本质是「车轮上的具身智能」。

怎么建立直觉

聊天模型 = 大脑在房间里答题;具身系统 = 大脑必须边走边看边刹车。出错代价从「说错话」变成「撞到东西」。

🦿
类比

纯 LLM 像书斋里的谋士;具身智能像必须下场踢球的球员——规则、体力、现场噪音全要扛。 哲学与认知科学上,「身体经验塑造认知」可追溯到具身认知传统;机器人学里 Brooks 的包容架构(subsumption)强调与环境紧密耦合的行为层(1980s)。

近年综述(如 arXiv:2402.02385《A Survey on Robotics with Foundation Models》、清华相关综述 Embodied AI: From LLMs to World Models)把具身进展概括为: 经典规划/控制 → 深度学习感知 → 大模型/多模态/世界模型驱动的通用机器人能力。

B. 上下游顺序:一辆车/一个机器人怎么「活」

无论无人驾驶还是机械臂,工程上常可粗分为同一条能力链(具体产品会合并模块):

具身智能上下游:感知到执行
上游 → 下游 传感器与感知 →(可选)世界模型/预测 → 规划与决策 → 控制与执行器 → 身体/底盘在真实世界产生结果,再反馈回感知。

1. 感知 Perception

相机、激光雷达、毫米波雷达、IMU… 回答「周围有什么、在哪」

↓

2. 理解与预测

检测跟踪、占用栅格、轨迹预测;进阶用「世界模型」想象下一步

↓

3. 规划 Planning

全局路线 + 局部轨迹:往哪开、怎么绕开障碍

↓

4. 控制 Control

油门/刹车/转向或关节力矩:把轨迹变成可执行指令

↓

5. 身体 + 环境反馈

车轮/手臂动了,世界变了,传感器再读——闭环

和软件 Agent 对照(结构意识)

软件 Agent:LLM + Tool + Loop。
具身 Agent:感知 +(世界模型)+ 规划 + 控制 + 物理 Loop。
共同难点:长尾场景、安全急停、可观测与评测。详见 Loop 工程。

C. 具身相关时间线(真实节点)

不背全部年份,抓住「范式切换」:规则/经典规划 → 学习驾驶 → 竞赛验证 → 商业 Robotaxi → 机器人基座模型。

1980s · 行为与导航实验

从符号规划到「贴地」行为

Brooks 提出包容架构,强调分层反应式控制、与传感器闭环。 CMU Navlab 等项目把计算与传感器搬上真实车辆做导航实验(Mobileye 等机构整理的 AV 史亦引用这一脉络)。

意义:智能开始「住进能移动的身体」,而不只在仿真逻辑里推演。
1988–1989 · 学习驾驶

ALVINN:神经网络端到端跟车

Dean Pomerleau 的 ALVINN(Autonomous Land Vehicle In a Neural Network,NIPS 1988 / CMU 1989)用多层网络把相机等输入映射为方向输出,在 CMU NAVLAB 上做道路跟随。 这是「用学习替代纯手写规则开车」的经典论文节点。 论文:NIPS 1988 ALVINN

和今天有关:后来端到端驾驶、模仿学习的思想远亲;也说明「数据+学习」很早就进了具身。
1995 · 长距离示范

No Hands Across America

CMU Navlab 5 完成匹兹堡到圣地亚哥长距离行程,转向自主比例极高(公开史述常引约 98% 转向自主),油门刹车仍由人负责——展示「高速路跟驰/车道保持」可行性。

2004–2007 · DARPA 挑战赛

从「没人跑完」到城市挑战

2004 DARPA Grand Challenge:沙漠越野,无车完成。
2005 五车完赛,Stanford Stanley 夺冠。
2007 Urban Challenge:城市场景,CMU 等获胜。激光雷达等传感路线被广泛验证。
官方:DARPA Grand Challenge · 复盘:IEEE Spectrum

意义:竞赛把「自动驾驶能工作」推到产业与资本议程,开启后十年创业潮。
2009–2016 · 产业启动

Google 自动驾驶项目 → Waymo;SAE 等级

Google 启动自驾项目(后独立为 Waymo)。 SAE J3016(2014 首版,后修订)定义 L0–L5 驾驶自动化等级,成为全球沟通标准。

约 2015–2018 · 辅助驾驶普及

量产 ADAS / Autopilot 进入消费市场

各车企与供应商推进 L1–L2 级辅助(自适应巡航、车道保持等)。 注意:营销用语 ≠ SAE 等级;L2 仍要求人类随时接管。

2018–2020s · Robotaxi 商业化

限定区域内的无人车服务

Waymo One 等在特定城市/运营设计域(ODD)推出面向公众的自动驾驶网约服务(公司官方时间线记载 Phoenix 等里程碑)。 中国亦有多家 Robotaxi 试点。共性:限定区域 + 高安全冗余 + 持续运营数据。

2022–2024 · 机器人 × 大模型

SayCan、PaLM-E、RT-2、OpenVLA…

Google 等提出 SayCan(语言模型接地到机器人可执行技能)、 PaLM-E(具身多模态语言模型)、 RT-2(Vision-Language-Action)。 开源侧出现 OpenVLA(约 7B 参数)等,推动「通用操作」研究。
SayCan 论文 · SayCan 代码 · PaLM-E · RT-2 · OpenVLA 论文 · OpenVLA GitHub

意义:具身从「专用栈」走向「基座模型 + 动作接口」,与软件侧 LLM Agent 浪潮汇合。

D. 切入点:无人驾驶「关键十年」怎么读

无人驾驶关键节点路径示意
读法 把「十年」理解为:竞赛证明可行 → 标准统一语言 → 辅助驾驶上量 → 限定域 Robotaxi → 学习型/端到端方法与安全运营并行。
阶段 大约时间 关键事实(可查证) 对应具身知识点
证明可行 2004–2007 DARPA Grand / Urban Challenge 传感融合、规划、真实环境闭环
产业成型 2009–2016 Google→Waymo;SAE J3016(2014) ODD、安全冗余、等级语言
消费辅助 2015 前后起 L1–L2 ADAS 大规模上车 人机共驾、接管责任
运营服务 2018 起 Waymo One 等 Robotaxi 公开服务 车队运维、远程协助、长尾场景
学习范式 2010s–2020s 模块化栈 vs 端到端/大模型增强(业界路线并行) 模仿学习、数据闭环、仿真

无人驾驶教会具身智能的 5 课

  1. ODD(运营设计域):先在限定天气/区域/速度内可靠,再谈扩展——不是一步 L5。
  2. 长尾(Long tail):罕见场景决定安全上限;数据与仿真要专门打长尾。
  3. 感知不是目的,闭环才是:看懂了却刹不住 = 失败。
  4. 人机权责:L2 与 L4 法律责任与用户心智完全不同(见 SAE)。
  5. 评测与运维是产品:上线后的监控、远程接管、事件复盘,和模型精度同等重要。

E. SAE 驾驶自动化等级(标准语言)

来源:SAE J3016(2014 提出,后与 ISO 协作修订)。从 L0 到 L5:

L0
无自动化
人全权驾驶;可有警告类功能。
L1
驾驶支持
横向或纵向辅助其一(如自适应巡航或车道保持之一)。
L2
部分自动化
横向+纵向同时辅助,人必须监督并随时接管。多数量产「高阶辅助」在此。
L3
有条件自动化
系统在 ODD 内可执行动态驾驶任务,但会请求人接管。
L4
高度自动化
在 ODD 内可不依赖人;Robotaxi 常见宣传层级。出 ODD 则限制运行。
L5
完全自动化
任意可行驶环境、不需人。目前仍是长期目标,而非普遍量产现实。

你可以怎么用这个标准

看车广告时问:它按 SAE 是 L几?是否要求手扶方向盘?是否限定高速/城市?别被「自动驾驶」四字带偏。

F. 通向更强智能时:还可能高频出现的概念

以下不是科幻清单,而是已在论文、开源或产业路线中反复出现、并与具身/通用智能讨论强相关的概念。 「AGI 时代」这里指:系统在多样任务与环境中更通用、更少为单一场景重写规则——是否达到严格 AGI 定义,学界仍有争议。

具身与通用智能相关概念示意
结构 世界模型、多模态基座、VLA、仿真到现实、开放式学习与对齐安全——构成讨论「下一代具身」的常用词汇表。
1
World Model 世界模型
是什么:内部模拟环境如何随动作变化,用于预测与规划。 代表脉络:Ha & Schmidhuber 世界模型论文;Dreamer 系列(如 DreamerV3);LeCun JEPA 等表示学习讨论;视频生成模型也被探索作世界模拟器(如 Sora 相关技术报告引发的讨论)。 和你有关:让机器人/车辆在「脑内预演」再行动,降低试错成本。
2
VLA · Vision-Language-Action
是什么:统一看图、懂语言、出动作的模型。代表:RT-2(Google DeepMind 等,arXiv:2307.15818)、开源 OpenVLA。 和你有关:对机器人说「把红杯子放到左边」成为研究主航道之一。
3
Embodied Multimodal LM(如 PaLM-E)
是什么:把连续传感器状态与语言放进同一大模型(PaLM-E, arXiv:2303.03378)。 和你有关:「大模型直接当机器人大脑」的路线图节点。
4
Skill grounding · SayCan 式接地
是什么:语言模型提出步骤,再用价值/可行性函数选择机器人真正能执行的技能(SayCan)。 和你有关:对应软件侧的 Tool/Skill,只是工具变成「抓取、开门、导航」等身体技能。
5
Sim2Real 仿真到现实
是什么:在仿真中训练策略,迁移到真机。开源仿真/平台如 Habitat、Isaac、MuJoCo 等被广泛使用。 和你有关:真机数据贵且危险,仿真是具身进步的加速器,也有「仿真偏差」问题。
6
ODD · 运营设计域
是什么:系统被设计和验证可运行的条件集合(区域、天气、速度等)。自动驾驶安全论证的核心概念。 和你有关:解释为何 Robotaxi 先在固定城市运营,而不是「全国随便开」。
7
Foundation models for robotics
是什么:用大规模预训练服务多种机器人任务(综述 arXiv:2402.02385)。 和你有关:类比 LLM 基座:少标数据也能适配新任务——仍在早期,但方向明确。
8
Open-ended / continual learning
是什么:持续从新环境学习、扩展技能,而不灾难性遗忘。开放环境智能体研究的常见主题。 和你有关:家庭机器人要适应「你家独特的桌椅布局」,不能只靠出厂固定技能包。
9
Constitutional / scalable oversight · 具身对齐
是什么:软件侧对齐方法延伸到「有身体的系统」:禁止危险动作、人在回路、可中断(与 Anthropic 等对齐研究、机器人安全文献交叉)。 和你有关:没有对齐与急停的具身系统,比会胡说的聊天机器人危险得多。
10
Multi-agent physical systems
是什么:多车编队、多机器人协作仓储。对应软件 Multi-Agent,但增加空间冲突与通信约束。 和你有关:未来城市可能是「车队+路边单元+云端调度」的系统,而不只是单车智能。
结构收束:若 AGI 讨论落到工程,具身侧更可能是 「多模态世界模型 + 可接地技能 + 仿真与真机数据闭环 + 严格 ODD/安全案例」, 而不是单独一个无限聊天窗口。

G. 和你有什么关系 · 你可以怎么用

普通人

理解 L2 与 L4 差别;坐 Robotaxi 时知道 ODD 与远程协助;对「全自动驾驶已普及」类话术保持核查习惯。

学生 / 转行

路径可参考:机器人感知(检测/SLAM 基础)→ 控制入门 → 强化学习/模仿学习 → 跟读 RT-2、OpenVLA、Dreamer 等开源与论文。

产品 / 业务

先定义 ODD 与失败模式,再谈模型;优先可中断、可复盘的闭环。软件 Agent 经验(评测、护栏)可迁移到具身,但必须加物理安全层。

和前面五页如何拼在一起

  • ① 结构:具身是「应用层」下的另一条身体栈,与纯软件栈并行。
  • ② 历史:LLM 爆发是软件侧;DARPA→Robotaxi 是物理侧。
  • ③ 通识:感知≈检索世界,规划≈Agent,控制≈Tool 执行,ODD≈Guardrail。
  • ⑤ 架构:模块化自动驾驶栈 vs 端到端/VLA,类似 Workflow vs 单一大模型路由。

H. 论文 · 标准 · GitHub(可点击跳转)

下列链接均为公开可访问的论文页、官方站点或 GitHub 仓库,点击即可打开原文。 产业节点变化快时,以监管与公司最新公告为准。

论文(arXiv / 会议)

GitHub 开源项目

标准 · 官方 · 赛事

软件 Agent 框架仓库(对照阅读)

与本站「架构选型」页对应,均可直接打开:

LangChain · LangGraph · CrewAI · AutoGen · LlamaIndex

跳转到本页全部链接 词库 · 具身词条 架构 · 软件框架 GitHub