具身智能(二):机器人如何描述身体与世界
上一篇文章从 Observation、State 与 Action 出发,建立了具身智能的整体框架:机器人通过执行闭环完成当前任务,再通过学习闭环将交互经验转化为新的能力。但当这些抽象概念落到真实机器人上,首先要解决一个更基础的问题:如何把机器人的身体、周围物体以及二者之间的空间关系,表示成可以计算和执行的数据。
仍以“把桌上的杯子放进托盘”为例。视觉系统可以识别杯子,并估计它在相机坐标系中的位置;机械臂规划和执行动作时,却需要知道杯子相对机器人基座在哪里、末端执行器当前是什么姿态,以及各个关节应该如何运动。机器人必须结合关节状态、相机外参和坐标变换,才能将“图像中的杯子”转换为“身体能够到达的抓取位姿”。坐标方向、旋转顺序、时间同步或标定参数的任何偏差,都可能让语义正确的决策变成物理世界中的错误动作。