强化学习大牛Sergey Levine:将RL作为可扩展自监督学习的基础( 二 )
在作者看来 , 这种方法论可以从当前基于学习的控制(强化学习,RL)算法中开发出来 , 尽管需要大量的算法创新才能使这类方法能够显著超越它们迄今为止所能解决的问题类型 。 这一想法的核心是这样一种概念:为了使用不同的和以目标为导向的方式控制环境 , 自主智能体必须发展对它们所处的因果和可泛化的环境的理解 , 因此可以克服当前监督式模型的很多缺点 。
与此同时 , 这还需要在以下两个重要方面超越当前的强化学习范式 。 一方面 , 强化学习算法需要用户手动指定任务目标即奖励函数 , 然后学习完成该任务目标所需的行为 , 当然 , 这种做法极大地限制了智能体在无人类监督时的学习能力;另一方面 , 现在常用的强化学习算法本质上不是数据驱动的 , 而是从在线经验中学习 。 尽管此类方法可以直接部署在真实世界环境中 , 但在线主动数据收集限制了它们在此类设置中的泛化能力 。 另外 , 强化学习的很多用例是发生在模拟环境中 , 因而很少有机会学习现实世界如何运作的 。
通过行动进行学习
人工智能系统之所以有用 , 是因为它们提供了可用于决策的推理 , 反过来推理又能影响世界 。 因此 , 我们可以得出这样的结论:一般的学习目标应该是为学习那些最有用、最有意义的事情提供动力 。 我们应该考虑强化学习如何为训练高容量模型提供自动化和原则性的目标 , 赋予模型理解、推理和泛化的能力 。
然而 , 这面临两个限制:强化学习需要手动定义奖励函数 , 此外 , 强化学习还需要一种主动学习范式 。 为了解决带有目标的问题 , 研究者开始开发新的算法 , 这些方法不同于执行单个用户指定的任务 , 而是旨在推理出所有可能结果 。 这些方法潜在目标包括学习达到任何可行状态、学习最大化潜在目标和结果之间的交互信息、通过有原则的内在动机目标学习得到覆盖广泛的结果 。 为了解决数据问题 , 研究者必须开发强化学习算法 , 以有效利用以前收集的数据集 , 其中离线强化学习算法提供了在多样性数据集上训练RL系统的途径 , 其方式与监督学习大致相同 , 然后进行一定量的主动在线微调以获得最佳性能 。

文章图片
举例来说 , 想象一个机器人执行各种任务 , 当给定用户指定的目标时 , 机器人执行该目标 。 然而 , 在机器人的「空闲时间sparetime」 , 机器人会想象它可以产生的潜在结果 , 然后机器人通过「实践practices」采取行动来产生这些结果 。 每一次这样的实践都会加深机器人对世界因果结构的理解 。
当然 , 在现实世界中以上述方式部署的商业机器人系统在概念上似乎有些牵强 。 这也正是离线RL重要的原因:由于离线算法与经验来源无关 , 因此机器人完成用户指定目标与「playing」所花费的时间比例可以调整为任一极端 , 甚至一个将所有时间都花在执行用户指定任务上的系统 , 仍然可以将其收集的经验用作离线训练数据来学习 , 以实现预期结果 。 这样的系统仍会与环境「play」 , 但只是在其「记忆memories」中进行了虚拟化 。
机器人系统可能是实例化这种设计最明显的领域 , 但这种设计不局限于机器人 。 任何具有明确定义行动概念的系统都可以通过这种方式进行训练 , 例如推荐系统、自动驾驶汽车、库存管理和物流系统、对话系统等等 。
在许多设置下 , 在线探索可能行不通 , 但通过离线RL以无监督结果驱动目标进行学习是可行的 。 如前所述 , ML系统由于能够做出智能决策非常有用 。 因此 , 任何有用的ML系统都处于一个顺序过程中 , 在这个过程中决策是可能的 , 因此 , 这种自监督的学习程序应该是适用的 。
- 网友热议|母亲回应3个孩子2个上清华:只能教孩子做人诚实守信 学习都靠自己努力
- 运用元宇宙技术强化“汉字田园”建设的初步构想
- 格力电器|不要再说Python难了,按照这个学习路线,四周速成Python
- OPPO|准大学生看过来!满足大学四年学习、生活需求平板,三件套不到2K
- 京东|Java:有哪些快速学习Java语言的技巧?
- meta|学习通被曝泄露1.7亿条信息!网友:快下架吧
- 零售业|陈根:学习通被曝大规模信息泄露,争议之下还有三点重要思考
- 新东方|新东方的成功转型,这几点不正是跨境电商卖家们需要学习的地方吗!
- 明码标价|3000元可购买整个学习通数据库?我们的信息被公开售卖,明码标价
- saas|学习通被曝信息泄露:超 1.7 亿条隐私数据仅售卖 1.2 万元!
