模型|数学奥赛冠军都做不对的题,却被拿来考ML模型?GPT-3:我不行( 二 )
预训练数据会对性能产生极大影响,而数学是在线文本的一小部分,于是该研究创建了一个大型多样化的数学预训练语料库。该预训练数据集 Auxiliary Mathematics Problems and Solutions (AMPS) 包括许多问题及 LATEX 格式的逐步求解过程。
AMPS 数据集包含 10 万个收集自可汗学院的数学问题,和约 500 万通过手动设计 Mathematica 脚本生成的问题。该研究使用 Mathematica 的计算机代数系统生成数学问题,是为了便于操作分数、超越数和解析函数。
这些问题涉及多个主题,包括代数、微积分、计数与统计、几何、线性代数,以及数论(参见下表 1)。
文章插图
实验模型性能
研究者通过实验调查了模型在 MATH 数据集上的性能,发现即使最优模型的准确率也很低。此外,与大多数基于文本的数据集不同,该数据集上的准确率增速随着模型规模的扩大而越来越慢。如果这一趋势继续,则要想在 MATH 数据集上取得较大进展,我们需要的不只是模型扩展,而是算法改进。
下表 2 表明,最小模型 GPT-2(0.1 billion 参数量,基线模型)在 MATH 数据集多个主题上的平均准确率为 5.4%,而 GPT-2(1.5 billion 参数量,参数量是基线模型的 15 倍)的平均准确率为 6.9%,相比基线提升了 28%。这表明与大部分其它基于文本的任务不同,在 MATH 数据集上增加模型参数确实有所帮助,但模型的绝对准确率仍然很低,且增速缓慢。
文章插图
此外,研究者测试了使用 AMPS 预训练的效果。未经 AMPS 预训练时,GPT-2 (1.5B) 模型在 MATH 数据集上的准确率为 5.5%;而经过 AMPS 预训练后,GPT-2 (1.5B) 在 MATH 数据集上的准确率为 6.9%(参见表 2),准确率提升了 25%。也就是说,AMPS 预训练对准确率的提升效果相当于参数量 15 倍增加的效果,这表明 AMPS 预训练数据集是有价值的。逐步求解
研究者对逐步求解过程进行了实验,发现模型在得到答案前先生成逐步求解过程会导致准确率下降。研究者利用 GPT-2 (1.5B) 进行评估,发现模型性能有所下降,从 6.9% 下降到了 5.3%。
研究者还对这些生成的逐步求解过程进行了定性评估,发现尽管很多步骤看似与问题相关,但其实存在逻辑问题。示例参见下图 3、4:
文章插图
图 3:问题、GPT-2 (1.5B) 模型生成的逐步解、真值解。
文章插图
图 4:问题、生成解和真值解示例。不过,研究人员发现逐步求解仍能带来一定好处:提供部分真值逐步求解过程可以提升性能,在训练过程中为模型提供逐步求解过程可以提升准确率。下图 6 展示了 GPT-2 (0.7B) 模型使用不同部分求解过程的准确率变化。
文章插图
上手实操:出海企业如何快速构建AI应用3月17日,亚马逊云科技机器学习产品经理李媛和亚马逊云科技机器学习产品技术专家王世帅将带来线上分享。本次分享将介绍如何借助Amazon Rekognition实现用户身份识别、图片视频内容审核与借助Amazon Personalize为用户提供个性化推荐。
- 数学|孩子数学考6分气哭爸爸 每天辅导深夜坚持一年多直言崩溃:教育专家回应
- 从几个月到几分钟,NLP模型运行效率暴涨,小公司也能玩大模型
- 腾讯文档|从事展览3d模型设计,你需要具备那些能力?---模大狮网
- 英伟达|NVIDIA Triton 推理引擎公开课上新:基于多实例 GPU 和 K8s 的大规模 CV 模型部署实践
- 肠道菌群|肠道菌群又有新“用途”:建立非酒精性脂肪肝发病预警模型
- aiXcoder XL智能编程大模型发布:自然语言一键生成方法级代码
- AI自己写代码让智能体进化!OpenAI的大模型有“人类思想”那味了
- 将数学题转化成代码,谷歌这项研究让机器证明的正确率大幅提高
- 字节跳动 AI Lab 提出多模态模型:X-VLM,学习视觉和语言多粒度对齐
- 电子商务|虚拟化身动作不协调?Meta开源肌肉骨骼动力学模型MyoSuite
