大酷樂
  • 汽车
  • 理财
  • 军事
  • 科技
  • 游戏
  • 互联网
  • 娱乐
  • 财经
  • 科学
  • 社会
  • 亲子
  • 电影
  • 健康
  • 教育
  1. 首頁
  2. 科学

两小时就能超过人类!DeepMind最新AI速通26款雅达利游戏

2023-07-03 简体 HK SG TW

今天小编分享的科学经验:两小时就能超过人类!DeepMind最新AI速通26款雅达利游戏,欢迎阅读。

DeepMind 的 AI 智能体,又来卷自己了!

注意看,这个名叫 BBF 的家伙,只用 2 个小时,就掌握了 26 款雅达利游戏,效率和人类相当,超越了自己一众前辈。

要知道,AI 智能体通过强化学习解决问题的效果一直都不错,但最大的问题就在于这种方式效率很低,需要很长时间摸索。

而 BBF 带来的突破正是在效率方面。

怪不得它的全名可以叫 Bigger、Better、Faster。

而且它还能只在单卡上完成训练,算力要求也降低许多。

BBF 由谷歌 DeepMind 和蒙特利尔大学共同提出,目前数据和代码均已开源。

最高可取得人类 5 倍成绩

用于评价 BBF 游戏表现的数值,叫做 IQM。

IQM 是多方面游戏表现的综合得分,本文中的 IQM 成绩以人类为基准进行了归一化处理。

经与多个前人成果相比较,BBF 在包含 26 款雅达利游戏的 Atari 100K 测试数据集中取得了最高的 IQM 成绩。

并且,在训练过的 26 款游戏中,BBF 的成绩已经超过了人类。

与表现相似的 Eff.Zero 相比,BBF 消耗的 GPU 时间缩短了将近一半。

而消耗 GPU 时间相似的 SPR 和 SR-SPR,性能又和 BBF 差了一大截。

而在反复进行的测试中,BBF 达到某一 IQM 分数的比例始终保持着较高水平。

甚至有超过总测试次数 1/8 的运行当中取得了 5 倍于人类的成绩。

即使加上其他没有训练过的雅达利游戏,BBF 也能取得超过人类一半的分数 IQM 分数。

而如果单独看未训练的这 29 款游戏,BBF 的得分是人类的四至五成。

以 SR-SPR 为基础修改

推动 BBF 研究的问题是,如何在样本量稀少的情况下扩展深度强化学习网络。

为了研究这一问题,DeepMind 将目光聚焦在了 Atari 100K 基准上。

但 DeepMind 很快发现,单纯增大模型规模并不能提高其表现。

在深度学习模型的设计中,每步更新次数(Replay Ratio,RR)是一项重要参数。

具体到雅达利游戏,RR 值越大,模型在游戏中取得的成绩越高。

最终,DeepMind 以 SR-SPR 作为基础引擎,SR-SPR 的 RR 值最高可达 16。

而 DeepMind 经过综合考虑,选择了 8 作为 BBF 的 RR 值。

考虑到部分用户不愿花费 RR=8 的运算成本,DeepMind 同时开发了 RR=2 版本的 BBF

DeepMind 对 SR-SPR 中的多项内容进行修改之后,采用自监管训练得到了 BBF,主要包括以下几个方面:

更高的卷积层重置强度:提高卷积层重置强度可以增大面向随机目标的扰动幅度,让模型表现更好并减少损失,BBF 的重置强度增加后,扰动幅度从 SR-SPR 的 20% 提高到了 50%

更大的网络规模:将神经网络层数从 3 层提高至 15 层,宽度也增大 4 倍

更新范围(n)缩小:想要提高模型的表现,需要使用非固定的 n 值。BBF 每 4 万个梯度步骤重置一次,每次重置的前 1 万个梯度步骤中,n 以指数形式从 10 下降至 3,衰减阶段占 BBF 训练过程的 25%

更大的衰减因子(γ):有人发现增大学习过程中的 γ 值可以提高模型表现,BBF 的 γ 值从传统的 0.97 增至 0.997

权重衰减:避免过度拟合的出现,BBF 的衰减量约为 0.1

删除 NoisyNet:原始 SR-SPR 中包含的 NoisyNet 不能提高模型表现

消融实验结果表明,在每步更新次数为 2 和 8 的条件下,上述因素对 BBF 的表现均有不同程度的影响。

其中,硬复位和更新范围的缩小影响最为显著。

而对于上面两个图中没有提到的 NoisyNet,对模型表现的影响则并不显著。

论文地址:

https://arxiv.org/abs/2305.19452

GitHub 项目页:

https://github.com/google-research/google-research/tree/master/bigger_better_faster

参考链接:

[ 1 ] https://the-decoder.com/deepminds-new-ai-agent-learns-26-games-in-two-hours/

[ 2 ] https://www.marktechpost.com/2023/06/12/superhuman-performance-on-the-atari-100k-benchmark-the-power-of-bbf-a-new-value-based-rl-agent-from-google-deepmind-mila-and-universite-de-montreal/

熱門排行
  • 王治郅:杨瀚森主要的问题是速度 他 王治郅:杨瀚森主要的问题是速度 他 郟君昊 | 2025-05-05
  • 贸易战烧进电影院:特朗普拟重税打击 贸易战烧进电影院:特朗普拟重税打击 習又夏 | 2025-05-05
  • 贷款追高炒黄金的人后悔了!有人一天 贷款追高炒黄金的人后悔了!有人一天 寸飛蘭 | 2025-05-05
  • 手机电池突破8000mAh?硅碳技术的回 手机电池突破8000mAh?硅碳技术的回 衛青柏 | 2025-05-05
  • 贷款追高炒黄金的人后悔了!有人一天 贷款追高炒黄金的人后悔了!有人一天 繁綺文 | 2025-05-05
  • 任天堂对Genki提起Switch 2商标侵 任天堂对Genki提起Switch 2商标侵 郜萌運 | 2025-05-05
  • 哪吒汽车APP和官网恢复正常 知情人 哪吒汽车APP和官网恢复正常 知情人 袁曼雁 | 2025-05-05
  • 极越汽车 CEO 夏一平名下青岛/义乌 极越汽车 CEO 夏一平名下青岛/义乌 集玲琳 | 2025-05-05
  • 全国经济第一大省明确,推动组建农商 全国经济第一大省明确,推动组建农商 佼昌翰 | 2025-05-05
  • 桑保利:亚马尔有配合意识&有点像梅 桑保利:亚马尔有配合意识&有点像梅 甄正浩 | 2025-05-05
  • 高露现身上海虹桥机场 黑色外套点缀亮色爱心装饰俏皮亮眼 高露现身上海虹桥机场 黑色外套点缀亮色爱心装饰俏皮亮眼 惠惠君 | 2023-05-02
  • 《歧路旅人2》:向光而生 《歧路旅人2》:向光而生 衛青柏 | 2023-05-02
  • vivo X90S曝光:处理器更新为天玑9200+ 安卓最强芯 vivo X90S曝光:处理器更新为天玑9200+ 安卓最强芯 袁曼雁 | 2023-05-05
  • “懒癌”发病率上升,定期体检别忽视 “懒癌”发病率上升,定期体检别忽视 幸聽楓 | 2023-05-02
  • 宋慧乔获百想视后 韩素希发图手动加爱心表情庆祝 宋慧乔获百想视后 韩素希发图手动加爱心表情庆祝 賁芳蕤 | 2023-05-02
  • 曹操墓,里面都有啥? 曹操墓,里面都有啥? 衛青柏 | 2023-05-02
  • 十年了,他们终于要HE! 十年了,他们终于要HE! 惠惠君 | 2023-05-07
  • 中央部署经济工作,释放5大信号 中央部署经济工作,释放5大信号 郜萌運 | 2023-05-02
  • 高德上线手机弯道会车预警功能 高德上线手机弯道会车预警功能 習又夏 | 2023-05-02
  • 陈自瑶抱病为爱女做蛋糕庆生,王浩信点赞没露面 陈自瑶抱病为爱女做蛋糕庆生,王浩信点赞没露面 賁芳蕤 | 2023-05-02
  • 等比例长大的童星,李兰迪算一个 等比例长大的童星,李兰迪算一个 郟君昊 | 2023-05-02
  • 高端国产车:军车血统,目前电动车越野的“天花板”? 高端国产车:军车血统,目前电动车越野的“天花板”? 謝飛揚 | 2023-05-02
  • 这些被抓来做实验的流浪狗,最终拯救了无数糖尿病人 这些被抓来做实验的流浪狗,最终拯救了无数糖尿病人 集玲琳 | 2023-05-02
  • 《云襄传》终于抬上来啦,男O女A让人好上头! 《云襄传》终于抬上来啦,男O女A让人好上头! 集玲琳 | 2023-05-02
  • 21家A股游戏公司2022年收入651亿 今年“游戏+AI”能否逆风翻盘? 21家A股游戏公司2022年收入651亿 今年“游戏+AI”能否逆风翻盘? 衛青柏 | 2023-05-04
  • 与周立波夫妇闹纠纷成老赖,唐爽被司法拘留15日 与周立波夫妇闹纠纷成老赖,唐爽被司法拘留15日 寸飛蘭 | 2023-05-05
  • 普京签署总统令,批准对俄刑法典相关法条的修正案 普京签署总统令,批准对俄刑法典相关法条的修正案 集玲琳 | 2023-05-02
  • 信用风险释放趋缓,结构性风险需重点关注 ——2023年一季度债市信用风险回顾与下阶段展望 信用风险释放趋缓,结构性风险需重点关注 ——2023年一季度债市信用风险回顾与下阶段展望 袁曼雁 | 2023-05-02
  • 解除资格!停止一切合作 解除资格!停止一切合作 佼昌翰 | 2023-05-02
  • 中银证券给予南京银行增持评级 中银证券给予南京银行增持评级 袁曼雁 | 2023-05-03
  • 3699起 联想小新mini主机上架 13代酷睿标压处理器 3699起 联想小新mini主机上架 13代酷睿标压处理器 習又夏 | 2023-05-05
  • 前董事长被免,天山生物全面进入“中植系”时代?股价曾在一月内暴涨超400% 前董事长被免,天山生物全面进入“中植系”时代?股价曾在一月内暴涨超400% 惠惠君 | 2023-05-02
  • 疯成这样,怎么还能被全网吹捧? 疯成这样,怎么还能被全网吹捧? 郜萌運 | 2023-05-02
  • 狂吼11次“让一下”!交警咆哮开道嘶吼到吐 狂吼11次“让一下”!交警咆哮开道嘶吼到吐 寸飛蘭 | 2023-05-03
  • 摩根大通收购美国第一共和银行 摩根大通收购美国第一共和银行 謝飛揚 | 2023-05-02
  • 台剧赢麻了,又来一部8.9 台剧赢麻了,又来一部8.9 衛青柏 | 2023-05-02
  • 事关农村土地承包和农民权益,《农村土地承包合同管理办法》5月1日起施行 事关农村土地承包和农民权益,《农村土地承包合同管理办法》5月1日起施行 郟君昊 | 2023-05-02
  • 下降45分,上涨35分!34所自划线院校复试分数线涨幅汇总 下降45分,上涨35分!34所自划线院校复试分数线涨幅汇总 袁曼雁 | 2023-05-07
  • "三高"已盯上青少年,做好这件事是关键 "三高"已盯上青少年,做好这件事是关键 習又夏 | 2023-05-05
  • 五一档没一个能打的 五一档没一个能打的 集玲琳 | 2023-05-05
  • 恐怖韩剧下神坛,这次胆小可入 恐怖韩剧下神坛,这次胆小可入 袁曼雁 | 2023-05-05
  • 这剧是不是用ChatGPT写的呀? 这剧是不是用ChatGPT写的呀? 惠惠君 | 2023-05-02
  • 200户连夜疏散,原因让人愤怒!“损失超一亿”,官方通报 200户连夜疏散,原因让人愤怒!“损失超一亿”,官方通报 袁曼雁 | 2023-05-03
  • 性骚扰惯犯,滚出娱乐圈 性骚扰惯犯,滚出娱乐圈 謝飛揚 | 2023-05-05
  • 48岁何炅自曝已老花眼,黄磊睡前认老,《向往的生活》证实将停办 48岁何炅自曝已老花眼,黄磊睡前认老,《向往的生活》证实将停办 佼昌翰 | 2023-05-02
  • 一个《长月烬明》倒了,《狐妖》《长相思》《与凤行》…在路上了 一个《长月烬明》倒了,《狐妖》《长相思》《与凤行》…在路上了 惠惠君 | 2023-05-02
  • 张天爱假期晒“酷”存照 卷发披肩穿黑色吊带裙大秀好身材 张天爱假期晒“酷”存照 卷发披肩穿黑色吊带裙大秀好身材 嬴覓晴 | 2023-05-02
  • 当年轻人开始不随份子钱 当年轻人开始不随份子钱 袁曼雁 | 2023-05-02
  • 毕滢用8年时间成功逼宫?曾被传已婚生子的她,不容小觑 毕滢用8年时间成功逼宫?曾被传已婚生子的她,不容小觑 幸聽楓 | 2023-05-03
  • 宋慧乔获视后首次晒照,拿奖杯笑容温柔 宋慧乔获视后首次晒照,拿奖杯笑容温柔 郜萌運 | 2023-05-02

©2022 大酷樂 版權所有

隱私政策 | 服務條款 | 聯繫我們