首页
学习
活动
专区
圈层
工具
发布

不到一个月从“小白”到“高手” 人形机器人这样打好乒乓球

一记精彩的反手抽杀,清华大学iPingPong战队的机器人拿下关键一分。在第二届世界人形机器人运动会乒乓球项目上,这位机器人“选手”以小组第一晋级,尽管在8月24日晚的淘汰赛中无缘四强,但它的精湛球技还是得到现场观众认可。

机器人需要“强化学习”和“对抗模拟”

让人意外的是,这位“机器人高手”学球还不满一个月。清华大学iPingPong战队学生队长郑梓昂介绍说,团队8月初才将完整技术链路适配至智元A3机器人,尽管时间紧迫,但为了冲刺最有价值的科研范式,他们整套算法依然没有采用传统分层决控架构,坚定探索最具潜力的端到端模型架构。这种模式的特点是算法设计和模型训练困难,但性能上限极高。郑梓昂进一步解释说:“比如它可以学会反手大力抽杀这样类似于专业运动员的技术动作,但是传统分层方案是不具备这种可能的。”

清华大学iPingPong战队的机器人在比赛中。北京日报客户端记者潘之望 摄

机器人打乒乓球,看似简单,实则困难。站在球台前,机器人首先需要感知环境、预测乒乓球轨迹;面对来球,更需要在几毫秒内作出判断与决策,并在保持自身运动稳定的情况下完成击球任务。整套流程对实时性、精准度、稳定性都有着极致要求。

为了达成目标,清华大学iPingPong战队采取强化学习和对抗模拟的方式让机器人学会打乒乓球。强化学习就是让机器人“自我博弈”,郑梓昂解释说:“这和人类的学习机制相似,机器人顺利完成击球、回球等指定任务时,我们就给予正向奖励;如果出现击球失误,就给予惩罚信号。通过此类探索试错的方式不断自主进化。”对抗模仿则是将人类视为老师,采集人类打乒乓球的全身运动数据,用于指导机器人打乒乓球,让它的打球方式越来越像人类。

清华大学iPingPong战队的机器人(左)在比赛中。北京日报客户端记者 潘之望 摄

为保障训练效果,郑梓昂与队友通过仿真训练与真机微调两种方式收集数据、迭代调试,帮助机器人提升球技。仿真训练是通过建立1:1仿真环境,让机器人虚拟对练。真机微调就是让机器人和人类对打。

团队成员带着相同的热爱走到一起

“我们团队其实之前都不太会打乒乓球,为了比赛才紧急学习的。”郑梓昂笑着说,有队员一天要和机器人打六七个小时,“我们穿上动作捕捉服装,记录数据,再喂给机器人。我们打得不好,怕把它‘带坏了’。”当被问到是否想找个高手甚至职业运动员采集数据时,郑梓昂坦言,“机器人也要像人一样一步步学习,先向初学者学习,到达一定水平后,会继续向高手学习。”

清华大学iPingPong战队的同学们不少都是大二、大三的本科生,2002年出生、正在读研究生二年级的郑梓昂是年龄最大的。郑梓昂向记者介绍说,团队成员的学术背景非常多元,他的研究方向是人形机器人全运动控制和视觉强化学习,其他队员的专业包括机械、力学、网络安全等,大家带着对人形机器人领域相同的热爱走到一起。

为了在本次比赛取得好成绩,郑梓昂和队友赛前一周就在“冰丝带”扎下了根,利用有限的时间反复调试机器人。他对记者说:“来参赛的队伍实力都非常强,这也激发了我们的斗志,大家这几天都住在‘冰丝带’。我觉得我们是最有能力、最有拼劲的团队。”

郑梓昂告诉记者,通过参加本次比赛,自己的组织和管理能力提升明显。他认为,AI时代,每个人在具体领域的能力差距变小了,更重要的是做事习惯与方法论,“我们团队最大的优势就是每个人的表达能力都很强,做事情前能提前规划好路径,这都非常重要。”他透露,团队中很多本科同学接下来都准备加入他所在的课题组读研,他本人则准备继续深造,读个博士,带着热爱继续深耕。

来源:京报体育

记者:赵晓松

  • 发表于:
  • 原文链接https://page.om.qq.com/page/OXXq1ZN3KE53EJbIjVcTOa-Q0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。

相关快讯

领券