近日,阿里AI在权威数据集CommonsenseQA上取得了重大突破,超越微软,成为第一名,显著提升了AI的常识推理能力。这项技术成果是由“95后”实习生叶志秀在达摩院科学家的指导下完成的。
CommonsenseQA是一个专门用于研究基于常识知识的问答任务的数据集,相比之前的SWAG、SQuAD等数据集,难度更大。目前最流行的自然语言处理模型BERT在SWAG和SQuAD上的表现已经接近或超过了人类水平,但在CommonsenseQA上的准确率仍远低于人类水平。
自然语言处理(NLP)是人工智能领域的重要分支,其中常识推理是最具挑战性的任务之一。在机器翻译、阅读理解等任务上,AI的表现已接近甚至超过人类水平。然而,AI在常识推理方面的能力远远不及人类。常识包括大多数人所了解并接受的基本事实,例如盐是咸的、下雨天要打伞等。人在回答问题时通常会结合这些显而易见的背景知识,但机器缺乏常识,无法将一些简单的陈述与逻辑假设自动关联起来。
深度学习领域的先驱、图灵奖得主Yann LeCun曾表示,即使是当前最聪明的AI,在常识方面也无法与猫匹敌。在包含1.2万多个常识问题的CommonsenseQA数据集上,最流行的AI模型BERT的准确率为56.7%,远低于人类的89%。
阿里巴巴达摩院语音实验室提出了一种名为AMS的方法,显著提升了BERT模型的常识推理能力。AMS方法采用了与BERT相同的模型结构,仅在预训练阶段进行了优化,而不增加计算负担的情况下,将CommonsenseQA数据集上的准确率提高了5.5%,达到了62.2%。
这项技术突破将大幅提高下一代人机交互产品的常识理解能力,适用于语音导航、智能电视、语音售票机等多种产品。例如,在导航系统中,如果AI具备常识,就能避免引导用户进入错误的位置,从而避免出现一些低级错误。
达摩院表示,未来将开源该模型和相关论文,与业界共享这一最新成果。