说话者|机器学习不能解决自然语言理解( 二 )
上述具有挑战性的语义理解功能都不能"大致"或"可能"正确——而是绝对正确。换言之,我们必须从对上述问题的多种可能解释中得到一个唯一的含义。
总而言之,对普通口语的真正理解与单纯的文本(或语言)处理是完全不同的问题。在文本(或语言)处理中,我们可以接受近似正确的结果。
这时候,我们应该可以清楚地明白:为什么NLP与NLU不同,为什么NLU对机器来说是困难的。但是NLU 的困难根源究竟是 什么?
为什么 NLU 很困难:文本容易丢失首先是"缺失文本现象"(MTP),我们认为它是自然语言理解中所有挑战的核心。语言交流如下图所示:演讲者将思想“编码”为某种自然语言中的话语,然后听众将话语“解码”为演讲者打算/希望传达的思想。"解码"过程是NLU中的"U"--即理解话语背后的思想。
文章插图
说话者和听者的思想语言交流
此外,"解码"过程中需要没有任何误差,才能从说话者的话语中,找出唯一一种意在传达的含义。这正是NLU困难的原因。
在这种复杂的通信中,有两种优化通信的方案:
说话者可以压缩(和最小化)在思想编码中发送的信息量,或者听者能做一些额外的工作解码(解压缩)话语;
演讲者多做一部分工作,把所有想要传达的思想信息告诉听者,减少听者的工作量。
该优化减少了说话者的编码信息,但也遗漏了听众可用的信息,但不会造成对话的背景信息丢失。
举个例子,对比下面黄色框中的未优化的文本和绿色框中优化的(等效但小得多的)文本。
文章插图
绿色框中较短的信息(我们通常就是这样说话的)传达了与较长的盒子相同的思想。通常,我们不会明确说明所有其他内容,因为我们都知道。这种技能几乎花了人类20万年的进化。
但这就是NLU的问题所在:机器不知道我们遗漏了什么,它们不知道我们都知道什么。
最终结果是NLU非常困难,如果它们不能以某种方式"整理"我们话语的所有的含义,那么软件程序将永远不能完全理解我们话语背后的想法。
NLU的挑战,并不是解析,阻止,POS标记,命名实体识别等, 而是解释或揭示那些缺失的信息。并隐含地假定为共享和共同的背景知识。
在此背景下,我们现在提供三个原因,说明为什么机器学习和数据驱动的方法不会为自然语言理解提供解决方案。
ML 方法甚至与 NLU 无关:ML 是压缩的,语言理解需要解压缩上述讨论(希望)是一个令人信服的论点,即机器的自然语言理解由于MTP(媒体传输协议,Media Transfer Protocol)而变得困难,因为我们日常口语被高度压缩,因此"理解"的挑战在于未压缩(或发现)缺失的文本。
机器的语言理解是困难的,因为机器不知道我们都知道什么。但 MTP 现象正是为什么数据驱动和机器学习方法虽然在某些 NLP 任务中可能很有用,但与 NLU 甚至不相关的原因。在这里,我们提出这个证据:
机器可学习性(ML) 和可压缩性(COMP)之间的等价性已在数学上建立。即已经确定,只有在数据高度可压缩(未压缩的数据有大量冗余)时,才能从数据集中学习,反之亦然。
虽然可压缩性和可学习性之间的证明在技术上相当复杂,但其实很容易理解:学习是关于消化大量数据并在多维空间中找到一个"覆盖"整个数据集(以及看不见的的函数具有相同模式/分布的数据)。因此,当所有数据点都可以压缩时,就会发生可学习性。但是 MTP 告诉我们 NLU 是关于解压缩的。因此,我们梳理出以下内容:
- 36氪首发|烹饪机器人公司「智谷天厨」获数千万元天使轮融资,羲融善道独家投资
- 网友热议|母亲回应3个孩子2个上清华:只能教孩子做人诚实守信 学习都靠自己努力
- 机器人|华为机器人新专利上线 网友:先有华为后有天开上鸿蒙如升仙
- 金字塔是时间机器?用途是拉伸和压缩时间,或能使生命延长和衰老
- 第六届全省中小学生互联网+机器人设计活动决赛顺利结束
- “文旅机器人小i”上岗
- 文旅机器人“小i”来了
- 如何评价扫地机器人离家出走一事?
- 李飞飞团队将ViT用在机器人身上,规划推理最高提速512倍
- 格力电器|不要再说Python难了,按照这个学习路线,四周速成Python
