ml|数学奥赛冠军都做不对的题,却被拿来考ML模型?GPT-3:我不行( 二 )
AMPS 数据集包含 10 万个收集自可汗学院的数学问题,和约 500 万通过手动设计 Mathematica 脚本生成的问题。该研究使用 Mathematica 的计算机代数系统生成数学问题,是为了便于操作分数、超越数和解析函数。
这些问题涉及多个主题,包括代数、微积分、计数与统计、几何、线性代数,以及数论(参见下表 1)。
实验
模型性能
研究者通过实验调查了模型在 MATH 数据集上的性能,发现即使最优模型的准确率也很低。此外,与大多数基于文本的数据集不同,该数据集上的准确率增速随着模型规模的扩大而越来越慢。如果这一趋势继续,则要想在 MATH 数据集上取得较大进展,我们需要的不只是模型扩展,而是算法改进。
下表 2 表明,最小模型 GPT-2(0.1 billion 参数量,基线模型)在 MATH 数据集多个主题上的平均准确率为 5.4%,而 GPT-2(1.5 billion 参数量,参数量是基线模型的 15 倍)的平均准确率为 6.9%,相比基线提升了 28%。这表明与大部分其它基于文本的任务不同,在 MATH 数据集上增加模型参数确实有所帮助,但模型的绝对准确率仍然很低,且增速缓慢。
此外,研究者测试了使用 AMPS 预训练的效果。未经 AMPS 预训练时,GPT-2 (1.5B) 模型在 MATH 数据集上的准确率为 5.5%;而经过 AMPS 预训练后,GPT-2 (1.5B) 在 MATH 数据集上的准确率为 6.9%(参见表 2),准确率提升了 25%。也就是说,AMPS 预训练对准确率的提升效果相当于参数量 15 倍增加的效果,这表明 AMPS 预训练数据集是有价值的。
逐步求解
研究者对逐步求解过程进行了实验,发现模型在得到答案前先生成逐步求解过程会导致准确率下降。研究者利用 GPT-2 (1.5B) 进行评估,发现模型性能有所下降,从 6.9% 下降到了 5.3%。
研究者还对这些生成的逐步求解过程进行了定性评估,发现尽管很多步骤看似与问题相关,但其实存在逻辑问题。示例参见下图 3、4:
图 3:问题、GPT-2 (1.5B) 模型生成的逐步解、真值解。
图 4:问题、生成解和真值解示例。
不过,研究人员发现逐步求解仍能带来一定好处:提供部分真值逐步求解过程可以提升性能,在训练过程中为模型提供逐步求解过程可以提升准确率。下图 6 展示了 GPT-2 (0.7B) 模型使用不同部分求解过程的准确率变化。
上手实操:出海企业如何快速构建AI应用
3月17日,亚马逊云科技机器学习产品经理李媛和亚马逊云科技机器学习产品技术专家王世帅将带来线上分享。本次分享将介绍如何借助Amazon Rekognition实现用户身份识别、图片视频内容审核与借助Amazon Personalize为用户提供个性化推荐。
- 单项冠军|再添三家“小巨人”,青岛高新区梯度培育见成效
- 摩托罗拉edgeS30冠军版,入手仅需1899元,那是非常值得的
- 数学|孩子数学考6分气哭爸爸 每天辅导深夜坚持一年多直言崩溃:教育专家回应
- 高通骁龙|iPhone 13成为国内Q1手机畅销榜冠军 京东到手价5399元起
- 删除|国产手机,靠前缀装饰而来的冠军,能否捍卫尊严?
- 他用机器人,圆了残奥会冠军的“行走梦”
- 618战报出炉:vivo X Fold斩获折叠屏手机销量&销额双冠军
- 打破厂哥厂妹称号,问鼎销量冠军,OPPO靠什么吸引了众多女性
- playstation5|618斩获多项冠军!三大因素助推荣耀逆势增长
- vivo|荣耀、vivo战报各执一词,谁是折叠屏销量冠军?数据不会说谎!
