关于具身智能以及具身智能操作系统的一些思考

  简单来说,具身智能(Embodied AI)是一个能够感知现实世界、理解环境、并通过自己的物理实体去行动和完成任务的智能体。

一、具身智能和具身智能操作系统

1.1 什么是具身智能

简单来说,具身智能(Embodied AI)是一个能够感知现实世界、理解环境、并通过自己的物理实体去行动和完成任务的智能体。

  • 物理实体:作为承载智能的身体,智能不再只存在于文本空间,而是依托机器人、无人机等物理载体通过各种传感器以及执行机构与物理世界耦合
  • 感知:通过各种传感器获取周围环境和自身状态信息,将物理世界转化为智能体能理解的数据
  • 理解:将感知得到的信息转化对环境、任务和自身状态的语义理解,并结合目标进行判断和推理
  • 行动:根据决策结果,通过各种执行机构作用域于物理世界

与被称为离身智能的数字世界的LLM相比,具身智能对于时间约束更加严格。在无人机这种对控制时延敏感的应用场景中,一旦决策时间过长,就有可能会造成不可挽回的结果。另外,从结果评价体系上来看,LLM是看其回答对不对,符不符合人类经验;具身智能是看最终任务有没有完成,过程是否安全。

1.2 我认为的具身智能操作系统

具身智能操作系统是位于基础模型与物理本体之间的一层系统软件。以 任务/会话 为基础调度单位,统一管理 感知——规划——控制——验证——安全——经验学习 的全流程,并对异构本体以及异构模型提供低耦合的接方式。

它并不是像传统意义上的操作系统,而是在传统机器人操作系统、机器人中间件、AI Agent、机器人控制框架上面形成的一种软件基础设施理念。

二、具身智能的现状

以下是基于三篇文章做的一个现状分析。

文章一:《大模型有了,机器人的“操作系统”在哪?》

这篇文章提出了一个核心问题:大语言模型从”问答工具”变成能感知、规划、记忆、持续改进的智能体之后,这套面向数字世界的框架怎么进入物理世界?

中山大学林倞教授总结了物理世界存在的四个问题:本体异构、环境不确定、状态观测不完整、执行风险。

文章中写道:一旦缺少统一的任务调度、结果验证和故障恢复机制,智能体的自我改进会在执行环节断裂。这也就证明了具身智能操作系统的必要性。

image.png
image.png

PhyAgentOS的三大设计主张:

  • OS 不替代模型,只决定”何时调用、谁来执行、如何验收、失败后如何继续”
  • 共享协议,而不是函数强绑定
  • SessionVerifier(会话验证器)——用初始任务定义 + 环境快照做语义验收,解决”执行完了 ≠ 做对了”

这篇文章强调的是将感知、规划、控制、验证、安全和经验积累组织成为持续运行的闭环。

文章二:《具身Claw:具身智能OS的大小脑协同具身智能体》

这篇文章首先从政府工作层面讲述了具身智能作为国家重点培养的未来产业,具有极大的发展空间。同时也提出了机器人行业长期面临的三大困局:

  1. 系统割裂:各个模块之间连不起来
  2. 实时性不足:即使各个模块之间连起来了,但是反应不够快
  3. 开发门槛高:开发人员要理解各个模块的内容,学习成本高,做起来不容易

除了以上三大困局外,机器人产品往往需要专业工程师进行现场部署和参数调优,这对于普通用户来说难以使用。即使完成部署后,受限于机器人的泛化能力,在不同的场景下就需要重新编程以及大量的人工示教。现实的专业调试要求与用户所期望的开箱即用体验之间存在巨大鸿沟。

文章中的具身Claw提出”大脑——协同——小脑“三层架构,并强调上下行双链路:

image.png
  • 大脑层:接收自然语言指令 → 用 VLM 做场景感知与语义理解 → 分解子任务
  • 协同层:把子任务转成语义指令与 Skill 调用 → 下发小脑层;同时整合自然语言与感知数据上报大脑层
  • 小脑层:控制执行层完成精准控制,把状态与执行结果回传协同层
  • 下行链路:大脑层调用推理决策层完成高层规划,将子任务拆解结果传递至协同层;协同层依托基础框架层转换为语义指令与 Skill 调用,下发至小脑层;小脑层借助控制执行层完成精准控制
  • 上行链路:小脑层将状态反馈与执行结果回传协同层,数据感知层实时采集多模态数据;协同层整合自然语言与感知数据上报大脑层,形成闭环

文章中还提到,具身Claw基于具身智能OS的底层能力,深度集成Coding Agent。

这对于开发者而言:无需掌握ROS/ROS2、运动控制等底层知识,专注算法与业务创新;对于普通用户而言:能够做到开箱即用,任务泛化性和自主性显著提升,更换场景无需重新编程。

我认为,这也是对于具身智能OS最终要达到的目标:通过OS将底层透明化,底层资源由OS统一调度,使得开发者能够在上层进行业务开发。

文章三:《SwarmGPT: Using LLMs to Control Drone Swarms》

  • 原文链接:SwarmGPT - Using LLMs to Control Drone Swarms - SwarmGPT - Learning Systems Lab
  • 来源:多伦多大学航空航天研究所(UTIAS)动态系统实验室
  • 时间:2025
  • 对应论文:Schuck, Dahanaggamaarachchi, Sprenger, Vyas, Zhou, Schoellig, “SwarmGPT: Combining Large Language Models with Safe Motion Planning for Drone Swarm Choreography”, IEEE Robotics and Automation Letters (RA-L), 2025

这是一篇课题组官方项目文档,它讲述了如何通过自然语言指令实现无人机集群飞行表演编排与实际部署。

在过去,无人机编队表演极难编程,对于缺少专业知识的普通人几乎是不可能完成的事情。SwarmGPT写道:SwarmGPT ensures that anyone, regardless of their background or technical skills, can create and deploy drone choreographies.

通过LLM,SwarmGPT彻底改变了传统无人机表演的编程模式,通过自然语言指令就能够实现表演编排,而无需关注底层究竟发生了什么。我认为,这是未来无人机开发的一个方向,自然语言编程能够大大降低无人机开发的门槛,使得对普通用户更加友好。

image.png

用户给出自然语言指令,LLM收到之后生成航点,系统通过与帝国一的运动原语将其编排成choreography。此时用户可以阅读编排结果,若不满意则reprompt后让LLM修改,直到用户满意。最终将编排结果通过axswarm安全滤波器后进行仿真验证,最终真机部署。

overview_5mb.mp4

配套组件:

组件 作用 技术细节
swarmGPT LLM 编排层 提供 UI,用户用自然语言交互,无需技术背景
axswarm 安全滤波器(轨迹规划器) 用 JAX 重写的 Python 版本,支持自动微分 + GPU/TPU 加速;“填补航点之间的空隙”
crazyflow 仿真软件 基于 JAX 的高性能仿真框架,高效并行化 + 自动微分
Crazyswarm 真机平台 8–20 架 Crazyflie 实飞

但是这个项目对于无人机具身智能操作系统来说,存在一些局限性:该项目属于无人机编队表演,并不是自主搜索或者侦察任务。无人机的轨迹是事先规划好,在用户以及安全滤波器审查后再执行的。

  • 非自主任务
  • 无感知闭环
  • 室内受控环境

因此,此项目适合作为无人机集群协同控制与具身智能系统的基础验证案例,能够体现多无人机之间的协同、任务调度以及安全控制能力,但尚不能充分体现具身智能所强调的自主感知、环境理解、动态决策和闭环交互能力。

三、面对的共同问题

  • 问题1:模型不等于系统。AI模型能够理解和规划任务,但是无法独立完成感知、通信、控制、安全等完整闭环。
  • 问题2:异构接入成本高昂。不同机器人、传感器和计算平台接口各异,导致大量重复的适配和集成工作
  • 问题3:执行完不等于做对。机器人完成动作并不代表任务达成,需要通过环境反馈验证结果进行动态调整。
  • 问题4:实时性与安全性没有独立保障。高层AI决策具有不确定性,而机器人底层控制要求实时、稳定和可验证。

因此,具身智能OS并不需要一个更强大的模型,而是需要一个能够将模型、机器人、环境、任务和安全机制组织起来的系统。

四、不同的尝试方案

文章一:PhyAgentOS——用“协议+验收”解决不可靠

  • 以session为调度单位:整条任务是一个可以追踪、可以验收的单元,而不是简单的一串actions

    将整个任务包装成一个Session。以一次无人机搜寻任务为例: 用户向系统下达“让无人机搜索东部区域,找到红色车辆后返回”的任务后,系统会创建一个独立的 Session,记录任务目标以及无人机的初始状态;随后持续记录无人机从起飞、搜索不同区域、发现并确认目标到最终返回基地的整个执行过程,同时同步记录环境变化和任务状态。任务结束后,Session 不仅记录“无人机执行了哪些动作”,还会结合最初的任务目标判断是否真正完成了任务,最终形成一份完整、可追踪、可验证的任务记录。

  • state-as-a-file:通过md、yaml文件配置将系统的“认知状态”和实际发生的“物理状态”显式分开。

  • 共享协议而非函数绑定:新本体、新模型可接入而不改接口;状态、过程、结果可检查、可审计。 PhyAgentOS 更希望使用一种统一的协议 / 状态 / 任务描述方式。

    机器人只要告诉系统:我是谁?我有什么能力?我现在的状态?我能否执行这个任务?

    例如:

    UAV1:
    capability:
      - fly
      - search
      - detect
    
    UAV2:
    capability:
      - fly
      - search
      - detect
      - thermal_imaging

    这样一来,上层Agent就不需要关注每个无人机用的是什么飞控,用的是什么SDK的细节问题。

  • SessionVerifier:用初始任务定义 + 环境快照做语义验收,区分”执行结束”与”语义完成”。

文章二:具身Claw——用“分层+全栈软件”解决系统割裂

  • 大脑—协同—小脑:三层异构计算:认知、调度、控制在物理上分离又协作 这种架构的一个重要特点是物理上的异构计算:高算力的大脑可以部署在云端或中央计算平台,而实时性要求较高的小脑部署在机器人端,从而同时兼顾智能性、协同性和实时性。

  • Intelligence BooM 五层栈:从 Agent 底座到数据感知的全链路软件模块

    • 具身 Agent 底座:负责多种 AI 模型和 Agent 的组织与编排,让机器人能够理解任务、调用能力。
    • 推理决策层:提供模仿学习、强化学习等能力,把高层任务转化为具体策略和行为。
    • 控制执行层:负责运动控制、执行加速和控制协同,将策略真正落实到机器人动作。
    • 基础框架层:提供通信中间件、异构计算以及 AI 框架等基础能力,让不同的软件、硬件能够协同工作。
    • 数据感知层:负责视觉、力觉等多模态数据采集、处理和管理,为上层模型提供真实世界的信息。
  • 1 大脑 + N 小脑:针对多机协作,云端统一规划、端侧并行执行

    一个大脑负责全局:理解用户任务、全局任务规划、多机器人任务分配、共享环境信息、根据执行结果重新规划。

    N个小脑部署再不同及其上:负责本机感知;执行具体skill;实时运动控制;反馈自身状态

文章三:SwarmGPT——用“稀疏输出+独立安全层”解决安全

  • LLM只输出稀疏航点,不输出控制量;由独立的axswarm来确保点与点之间如何飞的安全
  • 预定义运动原语:将LLM的组合空间限制在有限的原语之内
  • 放大用户作用:用户阅读编排结果,不满意就reprompt
  • 三级审查:人类审查+安全滤波+前置仿真

五、它们的共同点

  • 分层与解耦:将复杂的具身智能系统划分为不同层级,让各层承担明确的职责,减少模块之间的直接依赖。例如,具身Claw将认知、任务调度与运动控制分层,PhyAgentOS则将高层任务规划与底层任务执行分离。分层解耦能够降低系统复杂度,方便独立开发、调试与升级。
  • 将能力标准化为可复用单元:将机器人的功能封装成具有统一接口的能力模块,例如导航、抓取、目标搜索等 Skill,使上层智能体无需了解底层实现细节,就能组合调用这些能力。标准化能够减少重复开发,并提高不同模型、机器人本体和任务之间的兼容性。
  • 可检查、可审计、可追溯:系统不仅要执行任务,还要记录任务状态、执行过程、环境变化和最终结果。例如,PhyAgentOS通过 Session 记录完整任务过程,并利用 SessionVerifier 验证任务是否真正完成。这让系统出现问题时能够定位原因,也为任务验收、失败恢复和后续优化提供依据。
  • 外部约束先于执行:机器人不能仅凭 AI 模型的决策就直接执行动作,而应在执行前检查任务是否满足安全、资源和实时性等约束。例如,无人机需要遵守禁飞区、飞行高度、电量和避障要求,机械臂则需要满足运动范围与碰撞约束。通过独立的约束检查与安全机制,将 AI 的自主决策限制在可执行、可验证的安全范围内。

六、由自然群体智能启发的无人机具身智能体集群

前段时间在观察天上的鸟的时候注意到无人机集群和鸟群等自然群体有许多相似之处:

  • 鸟群:协同运动
  • 鱼群:动态避障
  • 蚁群:分工与任务分配
  • 蜂群:集体决策

从自然界可以得到一个重要启发:群体智能不一定来自一个无所不知的中央大脑,也可以由具备简单规则的个体,通过局部交互、信息共享和环境反馈自发形成。

不过,自然群体的行为机制并不都相同。鸟群、鱼群更适合说明协同运动,蚁群适合说明路径搜索和分布式优化,蜂群则可以启发群体决策。

维度 传统无人机集群 具身智能体集群
决策方式 预设规则、集中规划或分布式算法 智能体结合任务目标与实时环境自主决策
信息来源 位置、速度等状态信息为主 环境感知、任务语义、邻居状态等多源信息
协同方式 编队控制、轨迹跟踪、任务分配 局部交互、能力协作、动态任务重分配
环境变化 根据预设规则或规划器调整 感知变化、评估任务进展并重新规划
核心目标 让多架无人机协同完成指定动作 让多个具身智能体自主协作完成复杂任务

由此可以提出一个初步的架构设想

image.png

这里最关键的设计原则有三个:

  • 个体自主: 每架无人机具备局部环境感知、状态判断、避障和任务执行能力。
  • 局部交互: 无人机通过邻居状态、任务进度和环境信息进行协作,而不是所有决策都依赖中央节点。
  • 群体涌现: 通过个体规则和协作机制,使整个集群实现区域覆盖、目标搜索、队形调整和故障后的任务重组。

任务示例:多架无人机自主搜索指定区域,发现目标后共享信息,并根据环境变化动态调整分工。

  1. 任务下达

    用户要求搜索指定区域中的目标,系统将任务划分为多个搜索区域,并初始化集群任务状态。

  2. 分布式搜索

    每架无人机结合自身传感器和邻居信息选择搜索方向,减少重复搜索,并保持安全间距。

  3. 信息共享

    无人机 A 发现疑似目标后,将目标位置、置信度和相关观测信息共享给其他无人机。

  4. 动态重规划

    系统根据已搜索区域、目标线索、剩余电量和通信状态,重新分配搜索任务。

  5. 故障适应与任务验收

    如果无人机 B 退出任务,其他无人机重新分配其负责区域;最终根据搜索覆盖率、目标确认情况和安全状态判断任务是否完成。

相关研究

  1. 《无人机仿鸟群协同控制发展现状及关键技术》(2024)
  • 方向:借鉴鸟群的局部交互与自组织机制,实现无人机集群协同控制。
  • 意义:为自然群体智能向无人机集群迁移提供研究基础。
  • 论文原文
  1. 《Swarm Intelligence: A Survey of Model Classification and Applications》(2025)
  • 方向:群体智能模型分类及应用综述。
  • 意义:了解蚁群、粒子群等自然启发式算法的基本原理及应用。
  • 论文原文
  1. AeroWeaver: An Embodied-Agent Harness for Weaving Aerial Skills into Distributed, Adaptive Swarm Execution(2026)
  • 方向:将具身智能体、无人机技能和分布式集群协作结合。
  • 意义:与“无人机具身智能体集群”最直接相关,涉及局部决策、技能调用与执行经验更新。
  • arXiv 预印
  1. When Multi-Robot Systems Meet Agentic AI: Towards Embodied Collective Intelligence(2026)
  • 方向:提出具身集体智能(ECI)的概念框架。
  • 意义:探讨多机器人如何共享环境信息、协同行动并积累集体经验。
  • arXiv 预印

在思考自然群体智能对无人机集群的启发时,我注意到第三篇文章AeroWeaver。由于目前尚未深入阅读该论文,现阶段仅作初步了解。该研究尝试通过可复用技能、角色分工与执行反馈,将具身智能体与无人机集群的分布式协同执行相结合,为未来探索自然群体智能与无人机具身智能体集群的融合提供了一个值得关注的方向。