GLUE基准新打破:微软多义务模型初次超越自然言语人类基准

图灵汇官网

微软于6月7日在GLUE排行榜上提交了一款新模型,该模型在WNLI任务上的准确率达到89.0%,接近人类表现的95.9%。在此之前,大多数系统在WNLI上的准确率大约在65%左右,这款新模型显著提升了这一成绩,提高了20多个百分点。

GLUE是一个用于评估和分析多种自然语言处理任务模型性能的工具,主要通过各任务平均准确率来进行评价。WNLI是GLUE中的一个子任务,属于小型自然语言推理数据集。

近期,GLUE排行榜上出现了一些突破性的进展。6月5日,王玮提交的ALICE large ensemble系统在WNLI上取得了80.8%的准确率,而6月7日微软提交的MT-DNN-ensemble系统则达到了89.0%的准确率,进一步逼近人类水平。

当前GLUE排行榜显示,微软MT-DNN-ensemble系统在WNLI上的准确率为89.0%,接近人类水平;在GLUE基准测试中的平均得分为87.2,略高于人类得分0.1。这标志着机器在自然语言理解方面取得了显著进步。

此前,微软提出的新型NLP预训练模型已经在GLUE基准测试的11项任务中打破了BERT的性能记录。然而,当时微软的模型在WNLI上的准确率仅为65.1%。仅仅半年时间,微软的MT-DNN-ensemble模型就将这一数字提升了近24%,实现了显著的功能提升。

MT-DNN-ensemble是一个多任务框架,所有任务共享相同的结构,只是每项任务的目标函数有所不同。该模型采用了多模型集成的方式,虽然官方描述的参数量为3.5亿,但实际上可能更大。

MT-DNN-ensemble模型的核心在于其多任务深度神经网络架构。模型的低层部分在所有任务中共享,高层则针对具体任务进行设计。这样的设计使得模型能够处理各种自然语言理解任务,如单句分类、成对文本分类、文本相似性和相关性排序等。

与BERT模型类似,MT-DNN模型也分为预训练和微调两个阶段。不同之处在于,MT-DNN在微调阶段采用了多任务学习(MTL),在模型架构中包含多个特定任务的层。这种设计有助于模型更好地适应不同类型的自然语言理解任务。

总之,微软的MT-DNN-ensemble模型在自然语言处理领域取得了重要进展,不仅提高了WNLI任务的准确率,还展示了多任务深度神经网络的强大潜力。

本文来源: 图灵汇 文章作者: 龙飞科技