强化学习大牛Sergey Levine:将RL作为可扩展自监督学习的基础

选自arXiv
作者:SergeyLevine
编机器之心编译
编辑:杜伟、陈萍
论文不长 , 只有6页 。
目前 , 机器学习系统可以解决计算机视觉、语音识别和自然语言处理等诸多领域的一系列挑战性问题 , 但设计出媲美人类推理的灵活性和通用性的学习赋能(learning-enable)系统仍是遥不可及的事情 。 这就引发了很多关于「现代机器学习可能缺失了哪些成分」的讨论 , 并就该领域必须解决哪些大问题提出了很多假设 。
问题来了:这些缺失的成分是因果推理、归纳偏置、更好的自监督或无监督学习算法 , 还是其他完全不同的东西?在今年10月份的论文中 , 强化学习大牛、UC伯克利电气工程与计算机科学助理教授SergeyLevine提出并对这一问题进行了深入探讨 。
该研究认为利用强化学习可以衍生出一个通用的、有原则的、功能强大的框架来利用未标记数据 , 使用通用的无监督或自监督强化学习目标 , 配合离线强化学习方法 , 可以利用大型数据集 。 此外 , 该研究还讨论了这样的过程如何与潜在的下游任务更紧密地结合起来 , 以及它如何基于近年来开发的现有技术实现的 。
强化学习大牛Sergey Levine:将RL作为可扩展自监督学习的基础
文章图片
论文地址:https://arxiv.org/pdf/2110.12543.pdf
他认为这个问题很难回答 , 任何答案必然涉及大量猜想 , 但我们从人工智能近来的进展中吸取的教训可以提供几个指导原则 。
第一个教训是需要大量训练数据的大规模通用模型的「不合理」有效性 。 正如阿尔伯塔大学计算机科学系教授RichardS.Sutton在其文章《TheBitterLesson》中以及机器学习领域大量其他研究者所表达的那样 , 机器学习近来的研究主题始终是「高效利用大量计算和数据的方法通常优于依赖手动设计的先验和启发式方法」 。 虽然探讨造成这一趋势的原因超出了本文的探讨范围 , 但可以总结(或夸张地描述)如下:当我们为模型设计偏见或先验时 , 我们正在注入自己关于世界如何运作的不完善的知识 , 这使得模型得出了比我们自身设计的还要准确的结果 , 因而也会工作地更好 。
事实上 , 在人们如何获得熟练程度方面也表现出类似的模式 , 正如UC伯克利名誉教授S.E.Dreyfus等在著作《PhilosophyandtechnologyII》中所讨论的那样 , 遵循我们可以明确表达出的规则的「rule-based」推理往往只会为人们提供各种技能的「新手级」表现 , 而「专家级」表现往往与人们难以清晰表达的各种特例、例外情况和模式息息相关 。 正如Dreyfus所指出的 , 真正的人类专家很少能够清楚地阐明他们所展示的专业知识所遵循的规则 。 因此 , 正如人类必须要从经验中获得专业知识一样 , 机器学习也必须如此 。 为此 , 研究者认为 , 我们需要强大的、高容量的模型 , 这些模型施加的偏见较少并且可以处理大量所需的经验 。
第二个近期得到的教训是人工标记和监督在规模上远远不如无监督或自监督学习 。 我们看到 , 无监督预训练已经成为了自然语言处理的标准 , 并且可能将很快也成为其他领域的标准 。 从某种意义上来讲 , 这个教训是第一个教训的必须结果:如果大模型和大数据集最有效 , 那么任何限制模型和数据集大小的事情最终都将会成为瓶颈 。 人类监督可能就是这样一种瓶颈:如果所有数据都必须由人工标记 , 则系统从中学习所需的数据就会减少 。 但这里 , 我们遇到了一个难题:当前没有人类标签的学习方法往往违反第一个教训的原则 , 即需要大量的人类洞察力(通常是特定领域的)来设计允许大模型从未标注数据集中获得有意义知识的自监督学习目标 。 这些包括语言建模等相对简单的任务 , 以及「预测两个转换后的图像是否由同一个原始图像还是两个不同的图像各自生成」的更深奥的任务 。 后者是计算机视觉领域现代自监督学习中广泛使用且表现成功的方法 。 虽然这些方法在一定程度上有效 , 但我们将面临的下一个瓶颈可能是在无需人工标记或手动设计自监督目标时决定如何训练大模型 , 从而使得到的模型既可以对世界有深刻和有意义的理解 , 也能够在执行下游任务时表现出稳健泛化性(robustnessgeneralization)和一定程度的常识 。