Symbiosis Robotics unveils Direct Perception Control for humanoid robot go-kart driving
Symbiosis Robotics released a demo of a humanoid robot driving a go-kart, showcasing its Direct Perception Control (DPC) system. DPC eliminates the intermediate motion representation requiring a separate Whole-Body Tracker, allowing the model to compute joint and hand targets directly from visual, task, and body feedback. The system was trained on 15,010 hours of embodied data, addressing the gap between task understanding and whole-body control in humanoid robots.
Coverage timeline
机器之心机器之心
今天,Symbiosis Robotics(共生知行)放出了一段新演示。 画面里,机器人先压低身体,把四肢挪进卡丁车狭窄的驾驶位。驶上赛道后,它根据眼前的弯道调整方向,右脚踩油门、左脚控制刹车。镜头来到终点,卡丁车随即甩尾,原地漂了一圈。 几段赛道画面中,机器人根据弯道调整方向;镜头来到终点,卡丁车随即甩尾漂了一圈。 你别说,这套动作还真有点「机器人车手」的样子。 不过,热闹不只在漂移。 这段视频真正想回答的是一个更基础的问题:机器人已经看懂了弯道,接下来,怎样让这份判断及时变成全身的关节动作? 团队推出了 Direct Perception Control(DPC)。它取消了需要独立 Whole-Body Tracker 追踪的中间运动表示,让模型结合画面、任务和身体反馈,直接计算关节与手部目标。 为了训练这套系统,团队还整理了 15,010 小时具身数据。 机器人开卡丁车,难在哪里? 先看上车。 卡丁车座舱低矮又狭窄,机器人要压低躯干,重新安排髋、膝和四肢的位置,同时还得给双手留出握住方向盘的空间。 开起来以后,事情更多。 机器人一边要根据赛道画面判断弯道,一边要连续协调手脚:双手调整方向,右脚控制油门,左脚控制刹车。车速和转向一变,身体受到的反馈也跟着变,下一步动作必须马上调整。 换句话说,难点不只是「会转方向盘」或「会踩油门」,而是让感知、决策和全身控制在连续运动中接得上。 这正好暴露了人形机器人系统里一个长期存在的问题: 看懂任务的模型,和真正控制身体的模型,中间还隔着多远? 一层 Motion Interface,究竟限制了什么? 常见的人形机器人控制方案,会把「知道要做什么」和「让身体做出来」分成两层。 Figure Helix 用一套系统处理低频语义推理,另一套系统负责高频控制。Gemini Robotics 2 也分别使用 embodied reasoning model 与 VLA 完成任务推理和全身动作执行。〔2–3〕这类分层设计已经十分成熟,DPC 进一步探索的是:能否让负责认知理解的模型与直接生成关节动作的 motion expert 在统一训练中联合优化,使任务理解与全身控制相互适配,共同提升。 分层架构先生成运动表示,Whole-Body Tracker 再计算关节动作。DPC 考察接口是否保留足够信息,也关注训练怎样连接以及低层控制器
