Back to News

Former ByteDance, Tencent AI Researcher Sun Peng Joins Robotics Startup Xingchen Intelligence

#reinforcement-learning#robotics#ai-research#hiring

On September 2, 2026, Sun Peng, a former reinforcement learning expert at ByteDance and former head of Tencent's Robotics X agent center, officially joined robotics startup Xingchen Intelligence to lead technical R&D and application exploration in robot reinforcement learning. His work will focus on post-training for robots, addressing the shift from demonstrating capabilities to ensuring stable real-world performance. Sun's expertise spans robot RL, large-scale distributed RL systems, and LLM post-training, including development of ByteRL and the ReFT method.

Coverage timeline

  1. 机器之心新闻资讯

    9月2日,前字节跳动强化学习专家、前腾讯Robotics X智能体中⼼负责⼈孙鹏博⼠正式加入星尘智能,将重点负责机器人强化学习方向的技术研发与应用探索。 过去两年,机器人基础模型主要在解决“会不会”。但随着机器人从 Demo 走向真实部署和商业化,问题正在转向“能不能稳定做好”。如何让机器人根据真实执行结果持续修正策略,也让强化学习重新回到行业关注的中心。 孙鹏长期深耕强化学习(RL)、智能体(Agent)及多智能体强化学习(MARL),拥有横跨机器人强化学习、大规模分布式 RL 系统与大模型强化学习的研究与产业实践经历。他的加入将进一步强化星尘智能在机器人强化学习方向的布局,并与 AI 模型、具身 OS 和绳驱机器人本体形成协同,推动机器人在真实世界中持续学习、不断进化。 据了解,孙鹏加入星尘智能后,继续扩充机器人强化学习团队,推动相关技术能力提升和应用部署。 从腾讯到字节 深耕强化学习十余年 孙鹏博士毕业于清华大学,此后先后在康奈尔大学和罗格斯大学从事博士后研究。过去十余年,其研究与产业实践始终围绕强化学习与智能体展开,并逐步从机器人强化学习拓展至大规模 RL 系统与大模型后训练,形成了兼具算法研究与系统工程的技术积累。 早期在腾讯 AI Lab 及 Robotics X 机器人实验室期间,孙鹏曾担任智能体中心负责人,开展深度强化学习与机器人控制研究。他曾利用深度强化学习和对抗博弈训练轮式机器人,实现端到端主动目标跟随;同时研发《星际争霸》AI 智能体 TStarBots、TStarBotX,在多智能体强化学习(MARL)复杂博弈环境研究中取得重要成果。 加入字节跳动后,孙鹏将其技术实践由算法全面拓展至大规模 RL 系统工程。他主导开发了核心强化学习基础设施 ByteRL,支撑多款自研游戏 AI 的高效训练。其团队曾夺得 IEEE CoG 2023 策略卡牌 AI 竞赛冠军,研发的《炉石传说》AI 展现出击败行业顶尖选手的竞技水平。 随着大语言模型兴起,孙鹏进一步将强化学习积累拓展至LLM 后训练。在字节 AI Lab/ByteResearch 期间,他作为项目负责人参与研究并发布强化微调方法 ReFT(Reinforced Fine-Tuning)及数学推理智能体 DeltaProver;在 Seed 团队深度参与模型 RLHF 与预训练,在模型对齐、推理增强