gpu|仅用480块GPU就跑出万亿参数!达摩院发布全球首个“低碳版”巨模型M6( 二 )
从开始研发大模型起,阿里M6团队便格外重视GreenAI,即提升超大规模预训练模型的资源利用率与训练效率,沉淀大模型高效训练的能力。这样更多人可用较少的成本训练或者应用大模型。
针对大模型训练资源消耗过高的难题,达摩院联合阿里云机器学习PAI平台、EFLOPS计算集群等团队改进了MOE(Mixture-of-Experts)框架,创造性地通过专家并行策略,大大扩增了单个模型的承载容量。同时,通过加速线性代数、混合精度训练、半精度通信等优化技术,达摩院团队大幅提升了万亿模型训练速度,且在效果接近无损的前提下有效降低了所需计算资源。
他们首先更细致地探索了MoE在预训练模型中的各类超参对模型收敛速度和精度的影响,包括top-k的k值、capacity对load balance的影响、load balance本身对效果的影响。基于这一系列的观察,他们提出了一种Expert Prototyping的方法,使用分组MoE的形式,让不同组的MoE通过组合能在参数规模不变的情况下,增大模型的表达空间。
他们观察到在不同规模的模型上,分组MoE都能取得比baseline更好的效果。相比于单组switch routing的串行实现方式,分组MoE可以达到更好的加速效果,并且我们发现他在更大规模的模型上优势会变得更大,如下图:
在机器方面,M6团队最终采用的是在Hippo混布集群搭建模型的方案,利用的是480个单机单卡的NVIDIA V100-32GB的机器,通信为带宽为100Gb RoCEv2的RDMA网络网络,在XDL上提交任务。
3 M6已有哪些商业化应用?
AI设计师与智能新制造:经过试用期,M6将作为AI助理设计师正式上岗阿里新制造平台犀牛智造,通过结合潮流趋势进行快速设计、试穿效果模拟,有望大幅缩短快时尚新款服饰设计周期。随着实践经验的增长,M6设计的能力还将不断进化。
结合阿里的电商背景,M6团队希望通过M6大模型优异的文到图生成能力,和电商领域产业链深度融合,挖掘潜在的应用价值。具体来说,他们已深入到从服饰设计&生成、线上展示&测款的完整链路,期望利用M6的高清图像生成能力,缩短服饰企业的存货周转率,帮助商家对潮流趋势有更好的掌控力和更快速的反应力。
以下为M6参与新款服装设计的流程图:
工业级文案生成:除文生图外,M6也已具备可在工业界直接落地的图生文能力,能够快速为商品等图片提供描述文案。该能力目前已在淘宝、支付宝部分业务上试应用。
在参数规模不断升级的过程中,达摩院团队发现,M6的认知和表达能力也在不断提升:它能够观察到图片中更丰富的细节,并使用更精准的语言进行表达。
比如,在对下述风衣图片的描述中,更大参数规模的M6相比基础版,注意到了“经典翻领设计”“腰间系带装饰”“两侧大口袋点缀”等细节,生成文案信息量更大、措词更精准。
跨模态搜索:M6对图片、文本的精准理解及匹配能力,已在支付宝、手机淘宝中初步试应用,有望帮助提升用户跨模态搜索的效果。
M6团队观察到,淘宝上有很多长尾词,主要因为很多95后、00后用户有非常特别的商品需求,这些需求带来了很多长尾的搜索词。比如,有用户可能想要一个表面凹凸的咖啡杯,也就是日式风格凹凸咖啡杯,因为商家一般不会把这样的细节写在商品名和描述中,单纯基于文本的搜索很难搜出对应商品。
多模态大模型为精准的跨模态搜索带来可能。目前M6已建立从文本到图片的匹配能力,未来,或将建立从文字到视频内容的认知能力,为搜索形态带来变革。
4 M6团队接下来的规划?
达摩院资深算法专家杨红霞表示,“接下来,M6团队将继续把低碳AI做到极致,推进应用进一步落地,并探索对通用大模型的理论研究。”
- 池塘|骁龙8 Gen 2曝光:GPU简直太强了,完全不输苹果!
- RTX|联想拯救者Y9000K 2022将至:CPU峰值175W、GPU稳定175W
- GPU|摩托罗拉Razr 3研发中,竖向折叠屏手机市场开始热闹起来?
- 流行|AMD推出GPU性能比较工具:官方对比NVIDIA显卡性能
- 价值股|拼多多创始人黄峥,从创业到上市仅用三年,功成名就却选择隐退
- 英伟达|NVIDIA Triton 推理引擎公开课上新:基于多实例 GPU 和 K8s 的大规模 CV 模型部署实践
- GPU|菜鸟开始做自营物流,叫菜鸟直送,京东、顺丰慌了?
- 显卡|85万核心的世界最大AI芯片打破记录:要"杀死" GPU!
- GPU|苹果新系统抄袭华为鸿蒙系统?鸿蒙分布式系统有多超前?
- 一直以来|amd官方上线gpu比较工具:可查看游戏帧数
