强化学习大牛Sergey Levine:将RL作为可扩展自监督学习的基础( 三 )
无监督和自监督强化学习
无监督或自监督强化学习应该满足两个标准:首先其所学习的行动应该是以有意义的方式控制世界 , 此外 , 其能够提供一些机制来学习以尽可能多的方式控制自身行动 。
公式化自监督RL目标最直接方法是将其构建为达到目标状态的问题 , 该问题对应于训练目标条件策略π(a|s,g) , 并选择一些奖励函数r(s,g) 。 虽然这个奖励函数本身可能构成一个手动设计的目标 , 但同时也可以推导出一个框架 , 其中奖励函数是解决定义明确推理问题的结果 , 例如预测最有可能导致特定结果动作的问题 。 这个问题公式与密度估计、变分推理、基于模型的强化学习和探索相关联 。
一个经过训练以达到所有可能目标的策略能从世界中学到什么?正如最近的研究和RL中的经典文献所指出的 , 解决这种目标制约的RL问题对应于学习一种动力学模型 。 从直观上讲 , 要想实现任何潜在的预期结果 , 就需要深入理解行动如何影响长期环境 。 当然 , 有人可能会想 , 为什么不直接学习基于模型的RL中更常用的动态模型呢?模型学习也可能是利用不同数据集的有效方法 , 而不需要特定用户提供目标 。 因此 , 如果ML系统的最终目标是带来预期的结果 , 我们可以预测最终得出的目标和期望的目标一致 。
然而 , 当前方法会受到许多限制 , 即使是goalreaching条件下的RL方法也难以使用、稳定性不好 。 但更重要的是 , goalreaching并不涵盖RL中可以指定的全部可能任务 。 即使智能体学会了在给定环境中成功完成所有可能的结果 , 也可能不会存在一个单一的期望结果来最大化任意用户指定的奖励函数 。 这种以目标为条件的策略可能已经学习了强大且广泛适用的特征 , 并且可以很容易地针对下游任务进行微调 , 但对未来工作而言 , 一个有趣的问题是 , 更好地理解更普遍的自监督目标是否能够消除这种限制 。 目前 , 研究者已经提出了许多用于无监督获得技能的方法 , 因此 , 我们可以合理地提问 , 是否可以在此基础上推导出更普遍和更有原则的自监督强化学习目标 。
离线强化学习
如前所述 , 即使在是在在线收集无法实现的情况下 , 离线RL也可以应用自监督或无监督RL方法 , 并且此类方法能够作为将大型多样化数据集纳入自监督RL中的最强大的工具之一 。 这对于使其成为真正可行且通用的大规模表示学习工具至关重要 。 但是 , 离线RL提出了很多挑战 , 其中最重要的是需要它回答反事实问题:给定显示出结果的数据 , 我们是否可以预测在采取不同的行动时会发生什么?这非常具有挑战性 。
尽管如此 , 对离线RL的理解在过去几年取得了重大进展 。 除了了解分布转移如何影响离线RL之外 , 离线RL算法的性能也得到了显著提升 。 领域内开发出的一些新算法能够提供稳健性保证、离线预训练后的在线微调 , 以及解决了离线RL设置中的一系列其他问题 。

文章图片
自监督真实世界机器人系统RECON , 经过训练 , 该系统可以在从未见过的环境中执行导航任务 。

文章图片
使用离线RL训练的自监督真实世界机器人操作系统ActionableModels , 执行各种目标达成任务 。 该系统也可以作为通用预训练 , 以加速通过传统奖励在下游任务上的获取 。
此外 , 离线RL的进展也可能显著提升自监督RL方法的适用性 。 使用离线RL工具 , 我们可以构建不需要任何自身探索的自监督RL方法 。 与上文提到的「虚拟游戏」(virtualplay)非常相似 , 我们可以结合离线RL与目标条件策略 , 以完全从以往收集的数据中学习 。 然而 , 重大挑战依然存在 。 离线RL算法继承了标准或深度RL学习的很多困难 , 包括对超参数的敏感性 。 并且 , 由于我们无法执行多次在线实验来确定最佳超参数 , 这些困难会进一步加剧 。 在监督学习 , 我们可以使用验证集来处理这些问题 , 但离线RL中缺少相应的对等集(equivalent) 。 我们需要更稳定和更可靠的算法以及更有效的评估方法 , 以使离线RL方法真正得到广泛适用 。
- 网友热议|母亲回应3个孩子2个上清华:只能教孩子做人诚实守信 学习都靠自己努力
- 运用元宇宙技术强化“汉字田园”建设的初步构想
- 格力电器|不要再说Python难了,按照这个学习路线,四周速成Python
- OPPO|准大学生看过来!满足大学四年学习、生活需求平板,三件套不到2K
- 京东|Java:有哪些快速学习Java语言的技巧?
- meta|学习通被曝泄露1.7亿条信息!网友:快下架吧
- 零售业|陈根:学习通被曝大规模信息泄露,争议之下还有三点重要思考
- 新东方|新东方的成功转型,这几点不正是跨境电商卖家们需要学习的地方吗!
- 明码标价|3000元可购买整个学习通数据库?我们的信息被公开售卖,明码标价
- saas|学习通被曝信息泄露:超 1.7 亿条隐私数据仅售卖 1.2 万元!
