分享好友 资讯文章首页 资讯文章分类 切换频道

人工智能算法教机器人学走路:从零开始 耗时两小时

2019-03-14 19:27IP属地 广东佛山1140胡娜1慧聪网

近日,来自加利福尼亚大学伯克利分校和谷歌大脑的科学家们开发出了一套人工智能系统,它可以让机器人自己学会走路。这一成果发表于预印本网站arxiv.org上,论文题为《通过深度强化学习来学习走路》(learning to walk via deep reinforcement learning)。

在研究人员公布的视频资料中,四足机器人minitaur试图走过一个平整的缓坡。在视频开头,时间显示为0,这是四足机器人学习走路的开始。此时的四足机器人minitaur如一个蹒跚学步的婴儿,时而摇晃、时而原地踏步,它尝试着迈开“腿”前进,但身体却“诚实”地留在原地,整个行走过程进展缓慢。转变发生在minitaur学习走路的第一8分钟,这时它已经可以持续性地前进了,但平衡性稍显不足。后续的练习中,minitaur的步伐逐渐变得稳定且迅速。54分钟、72分钟、108分钟,不到2小时的时间,minitaur基本学会了快速且平稳地走过缓坡。

这就是四足机器人minitaur学习走路的全过程。加利福尼亚大学伯克利分校和谷歌大脑的科学家们研发出的人工智能算法“教”会了这个四足机器人穿越熟悉或陌生的地形。

在整个训练过程中,研究人员需要“手动”把走到缓坡尽头的机器人“请”回缓坡的起点以重新开始新一轮的练习,这一手动复位的过程稍显繁琐。不过,从结果来看,这一耗时2小时的学步过程实属高效,不少网友就此评价称“ai真是个好老师”。

在人工智能领域中经常提到“强化学习”的概念,这是一种使用奖励或惩罚的驱动来实现特定目标的人工智能方法,目的是获得一个策略以指导行动。比如围棋博弈中,这个策略可以根据盘面形势指导每一步应该在哪里落子。而在四足机器人minitaur学习走路的过程中,这个策略可以根据地形等要素告诉机器人下一步应该怎么走。

强化学习会从一个初始的策略开始。通常,初始策略不一定很理想,正如四足机器人minitaur在刚开始学走路的时候所表现的那样。不过。在学习的过程中,作为决策主体的四足机器人minitaur会通过行动和环境进行交互,不断获得反馈,即回报或者惩罚,并根据反馈调整优化策略。

强化学习是一种非常强大的学习方式。持续不断的强化学习甚至能够获得比人类更优的决策机制。最好的例子就是阿尔法狗。2016年,谷歌通过深度学习训练的阿尔法狗( alphago)程序以4比1的比分战胜了曾经的围棋世界冠军李世石。它的改进版更在2017年战胜了当时世界排名数一的中国棋手柯洁,其令世人震惊的博弈能力就是通过强化学习训练出来的。

但强化学习也有其局限性。它需要大量数据,在某些情况下需要数万个样本才能获得良好的结果。这就需要四足机器人minitaur像阿尔法狗那样进行多次训练,但过多的训练可能会对四足机器人造成损坏。

因此,这项“学习走路”的研究选择了强化学习的“升级版”——深度强化学习的方法,将深度学习的感知能力和强化学习的决策能力相结合。这种方法可以直接根据输入的图像进行控制,是一种更接近人类思维方式的人工智能方法。

用研究人员的话说,为了“使一个系统在没有模拟训练的情况下学习运动技能成为可能”,他们采用了一种名为“熵rl”强化学习框架熵rl可以优化学习策略,以极大化预期收益。在这个框架中,人工智能代理通过从策略中抽取某些行动并接收奖励的方式不断地寻找最佳的行动路径。

研究人员表示,“据我们所知,本实验是在现实世界中不经过模仿和预训练而直接学习欠驱动四足运动的第一个深度强化学习算法案例。

2018年5月,同个课题组的研究人员曾在arxiv.org上发表了另一篇关于四足机器人minitaur的研究论文。当时,研究人员使用深度强化学习的方法使minitaur从零开始学习四足运动,并最终实现了小跑和疾驰。

点赞 0
举报
收藏 0
打赏 0
评论 0
分享 4
余承东:很多车企抄华为鸿蒙座舱 但抄不到精髓
4月17日,华为举办“nova 11系列及全场景新品发布会”,问界M5高阶智能驾驶版将迎来首发。发布会上,余承东透露,他去看了上海车展,发现很多车企在抄他们的鸿蒙智能驾驶座舱,包括桌面UI设计都类似。但是他想说的是,其他车企只能抄到表面,是抄不到鸿蒙智能驾驶座舱的精髓。据了解,华为鸿蒙座舱3.0版本,已经实现了超级桌面、以及PC双屏协同等创新功

2023-04-1748

华为首发百万像素智能大灯:实时抠图、抠车 远光不炫眼
日前,2023华为智能汽车解决方案发布会于上海举办,华为智能汽车解决方案BU CEO余承东发表演讲。余承东介绍,此次发布会上,华为首发“百万级像素”智能车灯解决方案,为主机厂提供集安全照明、智能助驾、娱乐交互功能于一体的智能车灯,该方案可实现百万像素精细化照明和智慧灯光表达。车灯能根据道路实况自动多样化光型调节,预设算法像素级亮度调节,自适应道

2023-04-1739

搜索引擎是如何判断页面文章内容是否原创的
搜索引擎是如何判断页面文章内容是否原创的:本人最近在操作一个非主流站,内容是采集的,开始收录还好,后来不久就被k了,几万数据的站百度收录只剩几十。当然,我也知道一直采集也不是办法,可是人力有限,不可能去一条条加,也不现实。所以想搜索一下搜索引擎是怎么判定原创与否的,但很可惜,这方面的内容实在不多。然后我去以搜索工程师的角度去想了想,不禁一身冷汗啊,因为判定原创与否实在

2023-03-2334

万字长文!任正非:华为3年完成13000器件替代开发
近日,华为公司在深圳坂田总部隆重举办“难题揭榜”火花奖颁奖典礼,为在解题揭榜中做出突出贡献的获奖人员代表颁奖。华为创始人兼总裁任正非在“‘难题揭榜’火花奖公司内外的获奖者及出题专家座谈会”上发表了最新讲话。在座谈会上,任正非表示,华为在被美国制裁的这三年内,仍在持续投入研发。“2022

2023-03-1767

华为3年完成13000器件替代开发!任正非最新发言一览:自研IT系统全面启用
近日,华为公司在深圳坂田总部举办“难题揭榜”火花奖颁奖典礼,任正非的内部讲话也流出来了,其重申华为将会继续加强创新研发。任正非表示,华为现在还属于困难时期,但在前进的道路上并没有停步。“2022年我们的研发经费是238亿美元,几年后随着我们的利润增多,在前沿探索上还会继续加大投入。“他指出,面对打压,华为用三年时间内完成

2023-03-1749

nova双环设计!华为畅享60曝光:久违的麒麟芯片
3月23日14:30,华为将正式举行春季新品发布会,届时华为P60系列、Mate X3将一同发布,另外预计还有畅享60、高端手表、Freebuds Pro 2+等新品。据数码博主“看山的叔叔”透露,畅享60将会采用nova双环设计语言,预计与华为nova 10 SE的外观比较相似,后置双摄像头,一眼就可以认出是华为机型。此外,该博主称新机的配置

2023-03-1336

华为获“最佳移动网络基础设施奖”:5G带来10倍体验提升
在MWC2023巴塞罗那期间,华为MetaAAU系列产品荣获GSMA全球移动大奖(GLOMO奖)“最佳移动网络基础设施奖”,旨在表彰华为长期围绕Massive-MIMO极强性能、极致能效、极简部署等方向持续突破,帮助运营商打造性能最强、能效最高、部署最简、演进能力最强的5G网络。据了解,MetaAAU系列是华为首创的第三代AAU产品,包含Met

2023-03-0139

理想汽车2022年财报:全年营收超450亿元 研发费用翻倍
2月27日,理想汽车公布2022年第四季度及全年财报。财报显示,理想汽车营收和交付量双双再创历史新高。其中,第四季度实现营收176.5亿元,同比增长66.2%;季度交付量达到46,319辆,同比增长31.5%;全年实现营收452.9亿元,同比增长67.7%;全年交付133,246辆,同比增长47.2%。此外,理想汽车第四季度毛利率回归健康,达到20.2%,全年毛利率达

2023-02-2737

ChatGPT分析代码漏洞靠谱吗?华为算法专家实测:还得靠人工
OpenAI公司的ChatGPT最近爆火刷屏,这是一款人工智能技术驱动的自然语言处理工具,核心优势是通过基于自然语言处理技术模型、情景模型和语言模型来自动生成文章和代码。今日,华为中国官微发布了一篇来自华为安全AI算法专家,中科院博士李智华“从防御视角探讨ChatGPT对网络安全的影响”的文章,对ChatGPT在网络安全领域的应用进行能力评估。

2023-02-2448

不是 现在造车都得ChatGPT一下了吗?
ChatGPT的火,让全球概念股开启狂飙模式。单是在国内资本市场,像百度、科大讯飞、云从等一众AI企业,可谓是一路“大写”的涨涨涨。甚至是像搞手写识别、OCR的汉王科技都能连拉5个涨停板,引得不少网友直呼“这都能扯上关系”……但是家人们,正所谓“没有最意外,只有更意外”

2023-02-1448